Los 7 Problemas Más Comunes de CSV

Si alguna vez has importado un CSV a una base de datos, lo has abierto en una hoja de cálculo, o has intentado unir dos CSV, te has encontrado con estos problemas. Son universales. Aquí tienes la lista completa con la solución para cada uno:

ProblemaCómo se vePor qué ocurre
1. Filas duplicadasEl mismo registro aparece 2+ vecesExportación desde múltiples fuentes, añadir sin deduplicar
2. Espacios al inicio/final"New York " no coincide con "New York"Ingreso manual de datos, formato de Excel
3. Carácter BOMEl nombre de la primera columna tiene un prefijo  invisibleGuardado como "UTF-8 con BOM" desde Excel en Windows
4. Codificación incorrectaJosé se convierte en José o Jos?Latin-1 guardado como UTF-8, o viceversa
5. Nulos inconsistentesCampo vacío escrito como NULL, N/A, --, "" o en blancoMúltiples personas, sistemas o exportaciones contribuyendo datos
6. Coma/comillas dentro de camposLa fila se divide en el lugar equivocado, los campos se fusionanComas sin escapar en campos de texto como direcciones
7. Formatos de fecha mezclados01/02/2026 — 2 de enero o 1 de febrero?Formatos de fecha de EE.UU. vs Europa en la misma columna

Eliminar Filas Duplicadas — La Forma Correcta

No todos los "duplicados" son realmente duplicados. Hay tres niveles:

1. Duplicados exactos (todas las columnas coinciden)

Estos se pueden eliminar sin riesgo. La fila es literalmente idéntica. Usa la herramienta Eliminar Duplicados — compara filas enteras, conserva la primera ocurrencia, elimina el resto.

2. Duplicados por clave (una columna coincide)

Dos filas tienen el mismo email o ID pero otros campos diferentes. Esto es más delicado — debes decidir qué fila conservar. Quizás la que tiene la marca de tiempo más reciente? El conjunto de campos más completo? La deduplicación por clave requiere lógica de fusión, no solo eliminación.

3. Duplicados difusos (similares pero no idénticos)

"John Smith" vs "John Smyth" vs "Jon Smith". La misma persona, ortografía ligeramente diferente. La coincidencia difusa (distancia de Levenshtein, Soundex) ayuda, pero la deduplicación difusa automatizada es arriesgada. Revisa manualmente o establece un umbral de similitud alto (>95%).

💡 Regla de oro: Comienza con los duplicados exactos. Son los más fáciles de resolver y suelen representar el 80% de tu problema de duplicados. Luego revisa manualmente los duplicados por clave. Deja la coincidencia difusa para el final.

Espacios Invisibles Que Rompen las Uniones

Este es el problema de CSV más frustrante porque no puedes verlo. Tu VLOOKUP devuelve #N/A. Tu SQL JOIN no encuentra coincidencias. Los valores se ven idénticos. No lo son.

Problemas comunes de espacios:

  • Espacios al inicio: " New York" — espacio antes del valor. Ocurre cuando quien ingresa datos presiona la barra espaciadora antes de escribir.
  • Espacios al final: "New York " — espacio después. Aún más difícil de detectar.
  • Espacios de no separación:   — parece un espacio, no lo es. Común en datos extraídos de la web. El trim() normal no lo elimina.
  • Tabulaciones en lugar de comas: El archivo parece CSV pero el delimitador es realmente un tabulador. TSV disfrazado de CSV.

Nuestro Limpiador de CSV recorta automáticamente los espacios de cada campo. Para espacios de no separación, primero normaliza todos los caracteres Unicode de espacio a espacios estándar, luego recorta. Si estás limpiando en código, usa .replace(/\s+/g, ' ').trim() — la clase \s también captura espacios de no separación.

El Infierno de la Codificación: UTF-8, BOM y Texto Distorsionado

Los problemas de codificación en CSV vienen de un hecho: CSV no tiene forma integrada de declarar su codificación de caracteres. Un archivo CSV son solo bytes. El lector adivina. Cuando la suposición es incorrecta, obtienes texto distorsionado.

El Problema del BOM

Excel en Windows escribe CSVs como "UTF-8 con BOM" por defecto. BOM (Byte Order Mark) = tres bytes invisibles (EF BB BF) al inicio del archivo. La mayoría de las herramientas que no son de Microsoft no esperan estos bytes. Resultado: el encabezado de la primera columna recibe un prefijo .

// Ejemplo de corrupción por BOM
Encabezado esperado: "id","name","email"
Encabezado real:     "id","name","email"

// La consulta SQL falla: columna "id" no encontrada
// La clave JSON se convierte en "id" en lugar de "id"
// VLOOKUP no puede coincidir "id" porque en realidad es "id"

La solución: elimina el BOM. Nuestro Limpiador de CSV lo hace automáticamente. En código: verifica si los primeros tres bytes son 0xEF, 0xBB, 0xBF — si es así, elimínalos antes de analizar.

UTF-8 vs Latin-1

Si los caracteres acentuados (é, ñ, ü) aparecen como dos caracteres distorsionados como é, tu archivo es UTF-8 interpretado como Latin-1 (ISO-8859-1). Si aparecen como ?, tu archivo es Latin-1 interpretado como ASCII. La solución: establece explícitamente la codificación al abrir, o convierte el archivo con una herramienta.

El Flujo de Trabajo Más Rápido para Limpiar Cualquier CSV

  1. Abre el CSV primero en un editor de texto (no Excel). Revisa los datos sin procesar. Los campos están entrecomillados? Qué delimitador se usa? Hay basura evidente en las primeras filas?
  2. Elimina filas duplicadas — usa Eliminar Duplicados para deduplicación exacta.
  3. Limpia espacios y nulos — usa Limpiador de CSV para recortar todos los campos y estandarizar valores vacíos.
  4. Convierte si es necesarioCSV a JSON o JSON a CSV si estás cambiando de formato.
  5. Valida — cuenta las filas antes y después de cada paso. Si una operación de limpieza cambió el número de filas, investiga. No debería (excepto la deduplicación).
⚠️ Nunca abras un CSV de producción primero en Excel. Excel "amablemente" auto-formatea fechas, elimina ceros a la izquierda de IDs (000123 → 123), convierte números largos a notación científica (123456789012345 → 1.23457E+14), y guarda como UTF-8 con BOM. Abrir y volver a guardar un CSV en Excel puede corromper datos silenciosamente. Trabaja siempre sobre una copia.