Búsqueda de Unicode

Introduce un carácter misterioso, el espacio raro que tu usuario pegó, un glifo de una vista previa de fuente, un emoji que rompe tu regex, y la búsqueda devuelve su punto de código Unicode (U+XXXX) y los bytes UTF-8 en hexadecimal, una fila por carácter.

Cómo identificar un carácter Unicode

  1. 1

    Pega el carácter

    Puedes pegar un glifo o una cadena completa, cada carácter se analiza en orden.

  2. 2

    Lee el punto de código

    Obtén la notación canónica U+, en mayúsculas y rellenada con ceros a la izquierda hasta al menos cuatro dígitos hexadecimales.

  3. 3

    Inspecciona los bytes UTF-8

    Ve la secuencia de 1–4 bytes que ocupa el carácter en disco o en la red.

  4. 4

    Copia los resultados

    La salida es una tabla en formato CSV (carácter, punto de código, bytes UTF-8) que puedes seleccionar y pegar en una hoja de cálculo o en un informe de errores.

Trabajo típico de detective que puedes hacer con una búsqueda

La mayoría de los errores de Unicode se ven idénticos en pantalla. La única forma de distinguir un espacio regular de un espacio sin separación, o un apóstrofo curvo de una prima, es inspeccionar el punto de código.

Problemas comunes que resuelve la búsqueda

Se ve como En realidad es Punto de código
Espacio Espacio sin separación U+00A0
Espacio Espacio sin separación estrecho U+202F
(nada) Espacio de ancho cero U+200B
(nada) Conector de ancho cero U+200D
Apóstrofo Comilla simple derecha U+2019
Apóstrofo Prima (pies/minutos) U+2032
Guion Guion largo U+2013
Guion Guion no separable U+2011

Diseño de bytes UTF-8 de un vistazo

  • 1 byte, ASCII, U+0000 a U+007F (0xxxxxxx)
  • 2 bytes, Suplemento latino, árabe, hebreo (110xxxxx 10xxxxxx)
  • 3 bytes, CJK, la mayoría de los símbolos (1110xxxx 10xxxxxx 10xxxxxx)
  • 4 bytes, Emoji, scripts raros (11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)

Si tu columna de base de datos tiene una longitud de byte fija, un emoji de 4 bytes ocupará cuatro espacios aunque se renderice como un glifo, una fuente común de errores de truncamiento.

Preguntas frecuentes

Generalmente son marcadores BOM (U+FEFF) al inicio del archivo o conectores de ancho cero errantes de un procesador de texto. Pega uno en la búsqueda y te dirá inmediatamente, luego puedes eliminarlos con una simple búsqueda y reemplazo.

Sí. La búsqueda itera carácter por carácter, así que una palabra completa produce una fila por carácter con su punto de código y bytes UTF-8.

Un punto de código es la identidad abstracta de un carácter, U+00E9 siempre es “é” sin importar dónde lo almacenes. UTF-8 es una de varias codificaciones que convierten un punto de código en bytes; el mismo “é” es los dos bytes C3 A9 en UTF-8 pero el único byte E9 en Latin-1.

Sí. La búsqueda se calcula en nuestro servidor: los caracteres que pegas se envían, se analizan y se devuelven al instante su punto de código y sus bytes UTF-8. No almacenamos el texto que envías.

Herramientas relacionadas

Herramienta disponible en otros idiomas