Eliminador de duplicados CSV

Los duplicados se cuelan en las exportaciones CSV de maneras molestas: entregas de webhook repetidas, dos informes concatenados a mano, o una unión que expandió filas que no esperabas. Este eliminador de duplicados calcula el hash de cada fila de datos y mantiene solo la primera ocurrencia, por lo que la salida preserva tu orden de fila original mientras elimina silenciosamente las copias. La fila de encabezado es opcional: activa el interruptor si tu archivo comienza directamente con datos.

Cómo funciona la deduplicación

  1. 1

    Pega el CSV

    Incluye o excluye la fila de encabezado; usa la casilla de verificación para indicar a la herramienta cuál es.

  2. 2

    Se calcula el hash de cada fila

    Las filas se analizan en matrices y se utiliza un MD5 de su representación JSON como clave de unicidad.

  3. 3

    La primera vista gana

    Se conserva la primera fila con un hash dado. Las filas posteriores con el mismo contenido se omiten silenciosamente.

  4. 4

    Encabezado preservado

    Si el modo de encabezado está activado, la fila 1 siempre se pasa sin ser deduplicada contra los datos.

Qué cuenta como un duplicado

El eliminador de duplicados utiliza igualdad de fila completa. Dos filas son duplicados cuando cada celda coincide, posición por posición, después del análisis estándar de CSV.

Cosas que aún cuentan como diferentes

Fila A Fila B Tratadas como
Alice,30,Paris Alice, 30, Paris Diferente (espacios extra)
Bob,25 Bob,25, Diferente (celda vacía al final)
"Jane Smith",42 Jane Smith,42 Igual (el uso de comillas es a nivel de analizador)
TRUE,1 true,1 Diferente (sensible a mayúsculas)

Cuándo sería más apropiado un deduplicado a nivel de columna

La coincidencia de fila completa es estricta, lo cual es generalmente lo que deseas, pero a veces realmente quieres “una fila por correo electrónico independientemente de otras columnas”. En ese caso, primero usa el Extractor de Columnas CSV para reducir el archivo solo a la columna clave, deduplica eso y usa el resultado como búsqueda. O recurre a SQL: SELECT DISTINCT ON (email) * FROM users ORDER BY email, created_at DESC; en PostgreSQL, o un GROUP BY con agregados MIN() en otros lugares.

Consejos prácticos

  • Normaliza antes de deduplicar. Recorta espacios en blanco y estandariza el formato en las columnas clave primero, de lo contrario ALICE@EXAMPLE.COM y alice@example.com sobrevivirán ambos.
  • Ordena, luego deduplica, para resultados auditables. Si necesitas saber qué copia se mantuvo, ordena el CSV por tu desempate preferido (la marca de tiempo más reciente, el ID más bajo) antes de ejecutar el eliminador de duplicados.
  • Verifica el conteo de filas. Usa el Contador de Filas CSV en el original y en la salida para confirmar cuántos duplicados fueron eliminados.

Preguntas frecuentes

No, calcula el hash de filas completas analizadas. Para unicidad de una sola columna, reduce el CSV a esa columna primero usando el Extractor de Columnas y luego ejecuta el eliminador de duplicados.

La primera ocurrencia en el archivo. Ordena el CSV de antemano si deseas que una copia específica (el registro más reciente, el ID más bajo, etc.) gane.

Sí. Las filas se analizan con reglas estándar de CSV, por lo que "Jane, Smith" permanece como una sola celda y se compara como tal.

El CSV se envía a nuestro servidor para calcular la deduplicación. No se almacena ni se comparte, y no se añade al enlace de la página.

Herramientas relacionadas

Herramienta disponible en otros idiomas