Convertidor de HTML a Texto

Los correos electrónicos en texto plano, el análisis de texto y los flujos de conteo de palabras necesitan que el HTML se convierta en la cadena legible que un humano vería, sin artefactos de marcado. Pega HTML y esta herramienta elimina cada etiqueta, decodifica entidades (&&), colapsa los espacios en blanco creados por la indentación y produce un bloque limpio de prosa legible listo para análisis o para la parte text/plain de un correo electrónico multipart.

Cómo convertir HTML a texto

  1. 1

    Pega HTML

    Cualquier tamaño, un fragmento, un cuerpo de correo electrónico enriquecido o una página completa.

  2. 2

    Convierte

    Un clic: se eliminan todas las etiquetas y atributos y se decodifican las entidades.

  3. 3

    Revisa los saltos de línea

    Los párrafos, los elementos de lista y las filas de tabla se convierten en líneas separadas, así el texto conserva su estructura.

  4. 4

    Copia el texto

    La salida es texto Unicode plano, seguro para alimentar a un contador de palabras, una plantilla de correo electrónico o un modelo de sentimiento.

Cómo la conversión maneja etiquetas complicadas

Convertir HTML a texto es más que string.replace(/<[^>]+>/, ""): una expresión regular ingenua deja los códigos de entidad y los espacios de indentación en su lugar, y no sabe que </p> debería empezar una línea nueva.

Etiquetas a nivel de bloque vs en línea

Las etiquetas a nivel de bloque (<br>, y las etiquetas de cierre </p>, </div>, </h1> a </h6>, </li>, </tr>) producen un salto de línea cada una. Las etiquetas en línea (<a>, <span>, <strong>) no dejan espacios en blanco, por lo que las palabras no se fusionan.

Comportamientos específicos de etiquetas

Etiqueta Tratamiento
<br> Un salto de línea
</p>, </div>, </h1> a </h6> Un salto de línea por etiqueta de cierre
</li>, </tr> Un salto de línea; no se añaden viñetas ni separadores de celdas de tabla
<a href="url">texto</a> texto; el atributo href se elimina
<img alt="texto"> Nada, la etiqueta no tiene texto visible
<script>, <style> Se eliminan las etiquetas, se conserva el texto entre ellas

Decodificación de entidades

  • Las entidades nombradas (&amp;, &copy;, &eacute;) se decodifican a su carácter Unicode.
  • Las entidades numéricas (&#169;, &#x00A9;) también se decodifican.
  • Las entidades desconocidas se preservan literalmente, para que las herramientas de análisis las vean.

Normalización de espacios en blanco

  • Los espacios y tabulaciones antes de un salto de línea se eliminan.
  • Tres o más líneas en blanco consecutivas se reducen a una sola.
  • Los espacios entre palabras se conservan tal cual; el convertidor no reajusta el texto.

Usos

  • Generar la parte text/plain de un correo electrónico multipart.
  • Limpiar artículos extraídos antes de pasarlos a un modelo de lenguaje.
  • Alimentar un índice de búsqueda en texto plano.
  • Calcular un conteo de palabras honesto que ignora el marcado.

Preguntas frecuentes

El formato visual (negrita, color, fuente) se pierde, ese es el objetivo. La estructura sobrevive como saltos de línea: los párrafos, los elementos de lista y las filas de tabla se convierten en líneas separadas, así el texto sigue siendo legible.

El texto visible del enlace se mantiene, pero la URL se elimina junto con los atributos de la etiqueta. Si necesitas las URLs, usa en su lugar un conversor dedicado de HTML a Markdown.

El convertidor elimina las etiquetas, pero conserva el texto entre ellas, por lo que el contenido de los bloques <script> y <style> permanece en la salida. Elimínalo primero del HTML de origen si no lo quieres.

Sí. La salida es UTF-8 y preserva cada carácter no ASCII de la entrada. Entidades como &copy; y &eacute; se decodifican en sus equivalentes Unicode.

Herramientas relacionadas

Herramienta disponible en otros idiomas