Conversor de codificación de archivos de texto

Cuando un texto muestra café como café o naïve como naïve, los caracteres están bien: es la codificación la que se está leyendo mal. Pega el texto, indica al conversor con qué codificación debe leerlo y con cuál escribirlo, y lo recodifica de forma limpia entre UTF-8, UTF-16, ISO-8859-1 (Latin-1), Windows-1252 y otras páginas de códigos habituales. Copia el resultado corregido directamente en tu editor, hoja de cálculo o base de datos.

Cómo convertir la codificación de un texto

  1. 1

    Pega tu texto

    Cualquier texto que se vea corrupto o que necesites recodificar para otro programa.

  2. 2

    Revisa la detección

    Una pista orientativa muestra la codificación probable encima del cuadro.

  3. 3

    Elige la codificación de origen

    Ajusta «Desde» según cómo deban leerse los bytes: UTF-8, Windows-1252, ISO-8859-1, SJIS y más.

  4. 4

    Elige la codificación de destino

    UTF-8 es el estándar moderno; UTF-16, Big5 o GB2312 están ahí cuando un programa concreto los necesita.

  5. 5

    Convierte y copia

    El texto se recodifica y con un clic copias el resultado al portapapeles.

De dónde vienen los desajustes de codificación

Origen Codificación probable
Excel «Guardar como CSV» en Windows Windows-1252
Aplicación antigua de Windows Windows-1252
Utilidad Unix antigua ISO-8859-1 (Latin-1)
Editor moderno de macOS/Linux UTF-8
Texto japonés de Windows Shift-JIS (SJIS)
Chino simplificado de Windows GB2312
Chino tradicional (Taiwán/Hong Kong) Big5

Los síntomas clásicos

  • café aparece como café cuando los bytes UTF-8 se leen como Latin-1. Pon «Desde» en UTF-8 para volver a interpretar los bytes.
  • ñ se convierte en ñ por el mismo motivo.
  • Un doble mojibake como café significa que el texto se volvió a guardar tras la primera mala lectura, codificando otra vez la interpretación errónea.
  • Un  al principio es una marca de orden de bytes UTF-8 que se ha leído como tres caracteres Latin-1.

En cuanto reconoces el síntoma, el camino suele estar claro: lee el texto como lo que realmente es (Latin-1, Windows-1252 o lo que corresponda) y vuelve a escribirlo como UTF-8.

Marcas de orden de bytes

Este conversor no añade ni elimina una marca de orden de bytes por elección: el comportamiento depende de la codificación de destino. La salida UTF-8 no lleva BOM. La salida UTF-16 simple empieza con un BOM y es big-endian, mientras que UTF-16BE y UTF-16LE escriben los bytes sin BOM. Elige UTF-8 salvo que un programa concreto pida UTF-16.

Cuando un carácter no tiene equivalente

Algunos bytes no significan nada en la codificación de origen que elegiste, y algunos caracteres no se pueden representar en la de destino. Cuando ocurre, la conversión sustituye por un marcador en lugar de detenerse. Lo que más importa es acertar con la codificación de origen: una cadena de solo ASCII es válida en todas las codificaciones, así que un desajuste suele aparecer solo cuando hay caracteres acentuados o no latinos.

Preguntas frecuentes

Las listas «Desde» y «Hacia» ofrecen UTF-8, UTF-16, UTF-16BE, UTF-16LE, ISO-8859-1, ISO-8859-15, Windows-1252, ASCII, EUC-JP, SJIS (Shift-JIS), GB2312 y Big5. Puedes convertir de cualquiera de ellas a cualquier otra.

Para la web, las bases de datos y casi cualquier flujo moderno, sí. Las excepciones son aplicaciones antiguas de Windows que solo leen Windows-1252, algunas herramientas de mainframe antiguas y ciertos programas japoneses que esperan Shift-JIS.

Es una suposición orientativa basada en el patrón de bytes, elegida entre UTF-8, UTF-16, ISO-8859-1, Windows-1252 y ASCII. Puede fallar con textos cortos o de solo ASCII, así que tómala como una pista y ajusta tú mismo la codificación «Desde» cuando lo sepas.

El texto se envía a nuestro servidor para realizar la conversión y no se almacena una vez devuelta la respuesta. Para material confidencial, es preferible un editor sin conexión con conversor de codificación integrado.

Herramientas relacionadas

Herramienta disponible en otros idiomas