Pegue una lista de líneas y conserve únicamente los valores únicos. Además, puede eliminar líneas vacías, cambiar el uso de mayúsculas/minúsculas y ordenar el resultado. Antes de normalizar URLs, direcciones de correo, referencias e identificadores, verifique qué diferencias son relevantes en su sistema.
Qué se considera exactamente un duplicado
La herramienta compara cadenas de texto, no su significado. Los duplicados exactos son aquellos valores que coinciden tras las transformaciones seleccionadas.
Sin una limpieza previa, estas líneas pueden considerarse diferentes:
seo audit
SEO Audit
seo audit
Razones de las diferencias:
- mayúsculas o minúsculas distintas;
- espacio o tabulación al principio o al final;
- dos espacios en lugar de uno;
- espacio de no separación (NBSP);
- guiones o comillas tipográficas diferentes;
- carácter Unicode invisible;
- distinta forma gramatical u orden de las palabras.
Las frases comprar un sofá y sofá comprar no son duplicados exactos. Su posible cercanía semántica requiere un análisis aparte.
Orden seguro para limpiar una lista normal
Para palabras clave, etiquetas, ciudades o nombres suele funcionar este orden:
- conservar una copia del original;
- eliminar espacios y tabulaciones en los extremos de las líneas;
- suprimir líneas vacías;
- si es necesario, unificar mayúsculas y minúsculas;
- eliminar duplicados exactos;
- ordenar solo si el orden original ya no es necesario.
Las transformaciones deben aplicarse antes de eliminar duplicados. De lo contrario, Example y example permanecerían como líneas separadas y, tras un cambio posterior de mayúsculas, se convertirían en dos valores idénticos.
Duplicados exactos y semánticos
Duplicados exactos
seo audit
seo audit
Se pueden eliminar de forma automática.
Duplicados tras una normalización simple
SEO audit
seo audit
Coincidirán después de unificar mayúsculas y minúsculas y eliminar espacios al final.
Duplicados semánticos o canónicos
comprar un portátil
compra de un portátil
portátil comprar
Una utilidad básica no debería eliminarlos automáticamente. Para palabras clave se necesita analizar los resultados de búsqueda, la intención y aplicar clustering; para productos, las reglas del catálogo; para personas y organizaciones, identificadores o una verificación manual.
Especial cuidado con listas de URLs
No se debe convertir toda la URL a minúsculas sin excepción. Según el estándar, el esquema y el nombre del host no distinguen entre mayúsculas y minúsculas:
HTTPS://EXAMPLE.COM
https://example.com
Pero la ruta, los parámetros y el fragmento pueden ser sensibles a mayúsculas en sistemas concretos:
https://example.com/Catalog
https://example.com/catalog
Estas direcciones no se pueden considerar una única URL sin verificar el sitio.
Además, la herramienta de eliminación exacta no determinará automáticamente si estas variantes son equivalentes:
https://example.com/page
https://example.com/page/
https://example.com/page?utm_source=email
http://example.com/page
https://www.example.com/page
Su unificación depende de redirecciones, URLs canónicas, configuración del servidor y su objetivo. Primero elimine solo los duplicados exactos y luego analice la canonización por separado.
Qué tener en cuenta con las direcciones de correo
La parte del dominio después de @ se puede convertir a minúsculas. Con la parte local antes de @ la situación es más compleja: el estándar permite sensibilidad a mayúsculas, aunque muchos sistemas de correo modernos no la utilizan en la práctica.
Por ello, convertir todas las direcciones de correo a minúsculas suele ser práctico para una base de datos conocida, pero no debe considerarse una regla universalmente infalible. Para envíos masivos, tampoco basta con eliminar duplicados textuales: hay que considerar el consentimiento de los destinatarios, direcciones inválidas, bajas y contactos suprimidos.
Referencias, códigos, hashes e identificadores
En estos valores, las mayúsculas y minúsculas pueden ser parte del identificador:
abc123
ABC123
Antes de cambiar el uso de mayúsculas, consulte la documentación del CRM, la tienda, la API o la base de datos. Lo mismo aplica a códigos promocionales, tokens, UUID en formatos no estándar, nombres de archivo y claves de objetos.
Unicode y diferencias invisibles
Un texto aparentemente idéntico puede estar representado por secuencias Unicode diferentes. Por ejemplo, una letra con tilde puede almacenarse como un solo carácter o como una letra seguida de un signo diacrítico. Una comparación ordinaria podría considerarlas cadenas distintas.
También se encuentran:
- espacio de no separación (NBSP);
- espacio de no separación estrecho;
- caracteres de ancho cero;
- guiones diferentes:
-,–,—; - letras visualmente similares del alfabeto latino y cirílico.
La utilidad actual no está obligada a realizar una normalización Unicode completa ni a detectar sustituciones de alfabetos. Si tras la limpieza persisten duplicados misteriosos, verifique los puntos de código con un analizador especializado.
¿Es necesario ordenar el resultado?
Ordenar facilita la revisión y ayuda a detectar líneas similares cercanas, pero altera la secuencia original. Esto puede ser crítico para:
- listas de prioridades;
- colas de tareas;
- estructuras de menús;
- secuencias de comandos;
- datos donde una línea está vinculada a un número o a la línea adyacente.
Si el orden es importante, elimine duplicados conservando la primera aparición y no active la ordenación.
Escenarios prácticos
Palabras clave
Unifique mayúsculas y minúsculas, limpie los extremos de las líneas y elimine duplicados exactos. No elimine permutaciones de palabras ni formulaciones cercanas sin antes analizar los resultados de búsqueda y aplicar clustering.
Lista de dominios
Los nombres de dominio se pueden convertir a minúsculas. Verifique que la lista no contenga URLs completas con rutas y parámetros, ya que para ellas las reglas son más estrictas.
URLs de múltiples exportaciones
Primero elimine los duplicados exactos. Luego decida por separado si debe excluir parámetros UTM, fragmentos, la barra final, el protocolo o www. Esta decisión no se puede tomar de forma igual para todos los sitios.
Nombres de productos
La coincidencia exacta del nombre no siempre implica un producto duplicado: pueden diferir en tamaño, color, configuración o SKU. Y viceversa, un mismo producto puede tener nombres ligeramente distintos. Utilice la referencia o algún identificador estable.
Base de correos
Elimine líneas vacías y repetidas, pero no lo considere una preparación completa para el envío. Se necesitan verificar la sintaxis, el estado de suscripción, las bajas y las normas del servicio de correo específico.
Cómo verificar el resultado
- Compare el número de líneas antes y después del proceso.
- Revise varios valores eliminados, si la interfaz permite conservar el original junto al resultado.
- Asegúrese de que las mayúsculas y minúsculas no eran significativas.
- Verifique el principio y el final de la lista tras la ordenación.
- Para datos importantes, realice una importación de prueba con una pequeña parte.
Preguntas frecuentes
¿Por qué han quedado líneas similares tras eliminar duplicados?
Pueden diferir en espacios, mayúsculas, signos de puntuación, caracteres Unicode o la forma de las palabras. La herramienta elimina cadenas coincidentes, no el mismo significado.
¿Se pueden convertir todas las URLs a minúsculas?
No. Es seguro normalizar el esquema y el dominio, pero la ruta y los parámetros pueden distinguir entre mayúsculas y minúsculas.
¿Qué ocurrencia se conserva en caso de duplicado?
Normalmente se mantiene uno de los valores idénticos. Si para su tarea es importante conservar la primera o la última ocurrencia y el orden asociado, compruebe el comportamiento con una lista de prueba corta.
¿Por qué la ordenación ha roto la estructura de los datos?
La ordenación trabaja con cadenas de forma independiente y desconoce sus grupos semánticos. No la utilice para registros de varias líneas o columnas relacionadas que se hayan pegado como texto plano.
¿La herramienta eliminará duplicados de páginas con etiquetas UTM?
No como duplicados canónicos: las URLs con parámetros diferentes son cadenas distintas. Para unificarlas, debe determinar por separado qué parámetros se pueden eliminar sin alterar el significado.
Herramientas relacionadas: Procesador de textos; Combinador de palabras clave; Diffchecker.
Estándar oficial:
RFC 3986 — URI Generic Syntax: https://www.rfc-editor.org/rfc/rfc3986
