Comparador de Listas Difusas

Conciliar una exportación de CRM con una hoja de cálculo de clientes de facturas, o emparejar nombres de proveedores de dos ERP diferentes, casi siempre falla por pequeñas diferencias, “Acme Corp.” vs “ACME Corporation” vs “acme corp”. Pega ambas listas, establece un umbral de similitud y la herramienta sugiere el mejor candidato en la lista B para cada entrada en la lista A, marcando las que están por debajo del umbral para revisión manual.

Cómo emparejar dos listas desordenadas

  1. 1

    Pega la lista A

    Una entrada por línea, nombres de clientes, códigos de productos, direcciones.

  2. 2

    Pega la lista B

    El grupo de candidatos. Las diferencias en mayúsculas, espacios y errores tipográficos están bien.

  3. 3

    Establece un umbral

    Porcentaje de similitud por encima del cual se acepta un emparejamiento (70% es un valor predeterminado sensato).

  4. 4

    Lee el informe

    Cada elemento A se empareja con el mejor candidato B y una puntuación de confianza. Los elementos por debajo del umbral están marcados para revisión.

Cómo se mide la similitud

La herramienta utiliza similar_text de PHP (una puntuación de subsecuencia común más larga) y reporta el resultado como un porcentaje. Más alto es mejor; un emparejamiento exacto es 100%.

Umbral Comportamiento
≥ 95% Casi idéntico, solo diferencias en mayúsculas o espacios
80–94% Errores tipográficos, puntuación faltante, sufijos truncados
60–79% Cambios en el orden de las palabras, abreviaturas vs formas completas
< 60% Probablemente no es un emparejamiento real, revisar manualmente

Consejos

  • Normaliza primero si conoces el ruido común: minúsculas, elimina puntuación, colapsa espacios en blanco. Obtendrás puntuaciones más ajustadas.
  • Elimina sufijos de empresa (“Inc”, “Ltd”, “GmbH”) si aparecen de manera inconsistente en una lista pero no en la otra.
  • Divide direcciones largas, emparejar “calle + ciudad” por separado supera emparejar una línea concatenada.
  • Cuidado con uno a muchos. La herramienta elige el mejor emparejamiento B por cada entrada A; no impide que el mismo B coincida con múltiples filas A.

Cuándo usar un algoritmo más estricto

Para trabajos grandes de deduplicación, la distancia de Levenshtein o Jaro–Winkler superan a similar_text, especialmente en nombres donde la posición de los caracteres importa. Si el emparejamiento difuso afecta la facturación o fusiones, revisa 20 pares aleatorios antes de confiar en la salida a gran escala.

Preguntas frecuentes

El 70% captura la mayoría de los emparejamientos legítimos mientras marca los errores reales. Ajusta a 85% si la lista B está limpia y no puedes permitir falsos positivos; afloja a 55% si ambas listas son ruidosas y planeas revisar todo manualmente.

Sí, pero normaliza primero, elimina espacios, guiones y prefijos de código de país, convierte correos electrónicos a minúsculas. El emparejamiento difuso en valores en bruto reportará bajas puntuaciones para entradas estructuralmente idénticas.

Internamente, la herramienta convierte a minúsculas ambos lados antes de comparar, por lo que “Apple” y “apple” obtienen 100%.

Sí, el emparejamiento se ejecuta del lado del servidor, así que tus dos listas se envían a la herramienta para compararse. Se procesan en memoria para esa única solicitud y no se almacenan ni se registran después.

Herramientas relacionadas

Herramienta disponible en otros idiomas