Prepare palabras clave, URL, títulos, fragmentos CSV y otras listas de texto para importar o verificar. La herramienta elimina caracteres y líneas sobrantes, cambia mayúsculas/minúsculas, reemplaza delimitadores, ordena los datos y realiza varias operaciones en una sola pasada.
En qué orden procesar los datos
El resultado depende no solo de las acciones elegidas, sino también de su secuencia. Para una lista ordinaria línea por línea, este orden es adecuado:
- reemplazar el delimitador por un salto de línea;
- eliminar espacios y tabulaciones al inicio y final de las líneas;
- eliminar líneas vacías;
- si es necesario, convertir todos los valores a un mismo caso (mayúsculas/minúsculas);
- eliminar duplicados;
- ordenar el resultado solo si el orden original no es importante.
Por ejemplo, las cadenas example, Example y example parecen casi iguales,
pero antes de eliminar espacios y normalizar el caso pueden considerarse tres valores diferentes.
Qué hace cada operación y cuándo se necesita precaución
| Operación | Aplicación práctica | Qué verificar |
|---|---|---|
| Eliminación de BOM | corregir el carácter invisible antes del primer encabezado o valor | no eliminar BOM de un archivo UTF-16 sin conocer su codificación |
| Reemplazo de delimitador por salto de línea | convertir una lista separada por comas o punto y coma en una lista línea por línea | un simple reemplazo no respeta las reglas completas de CSV con comillas |
| Eliminación de líneas vacías | limpiar listas antes de la importación | una línea vacía a veces sirve como separador semántico entre bloques |
| Eliminación de saltos de línea | unir el texto en una sola línea | se perderán párrafos y límites de elementos |
| Eliminación de espacios sobrantes | corregir espacios repetidos dentro del texto | en código y datos formateados, los espacios pueden ser significativos |
| Recorte de bordes de líneas | eliminar espacios y tabulaciones accidentales | generalmente seguro para listas, pero no para fragmentos con formato fijo |
| Cambio de mayúsculas/minúsculas | unificar palabras clave, etiquetas o códigos | URL, identificadores, contraseñas y algunos valores son sensibles a mayúsculas/minúsculas |
| Eliminación de líneas por condición | excluir elementos de servicio o no deseados | verifique que el fragmento buscado no aparezca dentro de líneas útiles |
| Eliminación de duplicados | obtener una lista de cadenas únicas | la herramienta busca coincidencias exactas de cadenas, no el mismo significado |
| Ordenación | facilitar la verificación manual y la comparación | después de ordenar, la secuencia original no se conserva |
Qué es BOM y por qué interfiere con la importación
BOM es una marca de codificación de servicio al comienzo de un flujo de texto. En UTF-8 puede aparecer como un carácter invisible antes de la primera palabra.
Por eso, el sistema de importación a veces interpreta el primer encabezado como URL en lugar de URL,
no reconoce el nombre de la columna o añade un signo extraño al inicio de la línea.
Eliminar el BOM UTF-8 es útil cuando el sistema receptor no lo espera. Pero BOM también se utiliza para determinar el orden de bytes en UTF-16 y UTF-32. Por lo tanto, no se debe eliminar mecánicamente de cualquier archivo: primero hay que entender la codificación original.
Por qué reemplazar comas no siempre equivale a procesar CSV
Un CSV puede contener el delimitador dentro de un valor entre comillas:
"Madrid, centro",1200
Si simplemente reemplaza cada coma por un salto de línea, un valor se dividirá erróneamente en partes. El procesador es adecuado para listas simples y fragmentos en los que el delimitador no aparece dentro de los datos. Para archivos CSV complejos con comillas, escapes y varias columnas, se necesita un analizador CSV completo.
Cuidado con las URL y los identificadores
No aplique la conversión a minúsculas a toda la lista de URL sin verificación. En una dirección, el esquema y el dominio no distinguen entre mayúsculas y minúsculas, pero la ruta y los parámetros en un servidor específico pueden variar:
https://example.com/Catalog
https://example.com/catalog
Estas direcciones pueden llevar a páginas diferentes. Tampoco se debe cambiar el caso de tokens, códigos de artículo, hashes, claves API, códigos promocionales e identificadores si no se conocen las reglas del sistema.
Conteo de longitud: caracteres, bytes y emojis
Diferentes sistemas pueden contar la longitud de una misma cadena de maneras distintas. Una letra normal suele contar como un carácter, mientras que los emojis, los signos compuestos y algunas combinaciones Unicode pueden ocupar varias unidades de código. Por lo tanto, el resultado de un contador en línea no siempre coincide con el límite de un CMS, plataforma publicitaria o base de datos específicos.
Para títulos, descripciones y textos publicitarios, verifique no solo el número de caracteres, sino también cómo se muestra realmente la cadena en el sistema correspondiente.
Escenarios prácticos
Preparación de semántica
Pegue una lista de consultas, elimine espacios al inicio y final y líneas vacías, unifique el caso, elimine duplicados. Ordene solo después de la limpieza, si el orden de exportación no es importante.
Conversión de una lista desde una tabla
Si los valores se copiaron con tabulaciones u otro delimitador simple, reemplácelo por saltos de línea. Luego revise manualmente algunas líneas para asegurarse de que no haya ese carácter dentro de los valores.
Limpieza de una lista de URL
Elimine líneas vacías y espacios en los bordes, pero no cambie el caso de las rutas y parámetros. Después de la limpieza, es útil verificar la lista con la herramienta de eliminación de duplicados.
Exclusión de líneas no deseadas
La función de eliminar líneas por fragmento es adecuada, por ejemplo, para excluir un dominio de servicio, un parámetro o una palabra. Primero pruebe la condición en una copia pequeña: la búsqueda por un fragmento corto puede eliminar más líneas de las esperadas.
Cómo no perder los datos originales
Antes del procesamiento por lotes, guarde el original. Especialmente importante al eliminar líneas, combinar párrafos, ordenar y cambiar el caso: tales operaciones no se pueden deshacer de manera fiable después de copiar el resultado sobre la lista original.
Preguntas frecuentes
¿Se puede procesar un archivo CSV real?
La herramienta es adecuada para texto y fragmentos CSV simples. Si el archivo tiene varias columnas, comillas, saltos dentro de celdas o delimitadores escapados, utilice un programa que analice CSV según sus reglas.
¿Por qué después de eliminar duplicados quedan líneas similares?
Pueden diferir en mayúsculas/minúsculas, espacios, espacios inseparables o caracteres invisibles. Primero realice una normalización adecuada y luego repita la eliminación de duplicados.
¿Es seguro convertir todo el texto a minúsculas?
Para palabras clave comunes, a menudo sí. Para URL, códigos, identificadores, contraseñas y código de programa, no: el caso puede cambiar el significado.
¿La operación elimina todos los caracteres Unicode invisibles?
No necesariamente. La eliminación de BOM afecta a una marca de servicio específica, no a todos los espacios inseparables, caracteres de ancho cero y otros signos invisibles.
Herramientas relacionadas: Eliminación de duplicados; Diffchecker; Combinador de palabras clave.
