Extraer URLs del Texto

Pega un registro de chat, un documento markdown, un hilo de correo electrónico o un volcado HTML en bruto y obtén una lista limpia de todos los enlaces http:// y https:// que contiene. El detector elimina la puntuación final, reconoce la sintaxis de enlaces markdown y HTML y quita los duplicados exactos, para que puedas enviar la lista directamente a un rastreador o a una herramienta de archivado.

Cómo extraer URLs

  1. 1

    Pega la fuente

    Inserta el texto o HTML. Las comillas, los corchetes angulares, la sintaxis de enlaces markdown y la puntuación final se manejan automáticamente.

  2. 2

    Ejecuta el escaneo

    Se detectan todos los enlaces `http://` y `https://`, se recorta la puntuación final y se eliminan los duplicados exactos.

  3. 3

    Revisa el recuento

    Verás cuántas URLs únicas se encontraron y la lista completa.

  4. 4

    Copia o exporta

    Una URL por línea, lista para `curl -I`, un archivador, un servicio de capturas de pantalla o listas semilla de Screaming Frog.

Qué cuenta como una URL

La detección de URLs es más difícil de lo que parece, y este extractor sigue deliberadamente una regla segura: solo reconoce enlaces completos http:// y https://. Todo lo demás permanece en tu texto.

Formas reconocidas

Forma Ejemplo
HTTPS absoluto https://example.com/path?q=1
HTTP absoluto http://example.com
Destino de enlace markdown [text](https://example.com)
href absoluto en HTML href="https://example.com"

Reglas de recorte

La puntuación final se elimina, así (https://example.com). se convierte en https://example.com. Los espacios, comillas, corchetes angulares, paréntesis, corchetes, comas y puntos y comas detienen la detección. Una URL que contenga paréntesis se corta en el primer paréntesis de apertura, por lo que un título al estilo de Wikipedia solo se captura hasta el paréntesis de apertura.

Qué omite

  • mailto:, tel:, ftp: y cualquier otro esquema que no sea http o https.
  • Enlaces relativos al protocolo como //cdn.example.com/asset.js.
  • Dominios sin esquema y direcciones con prefijo www. sin protocolo, como example.com/docs/intro o www.example.com/page.
  • Fragmentos solo de ancla como #section y pseudo-URLs de JavaScript.

Cómo se gestionan los duplicados

Se eliminan los duplicados exactos: https://example.com cuenta una sola vez por muchas veces que aparezca, mientras que Example.com y example.com se mantienen como entradas separadas. La lista conserva el orden en que aparece cada URL por primera vez.

Consejos de posprocesamiento

  • Minúsculas para una deduplicación canónica. Si Example.com y example.com deben contar como un mismo host, pasa la salida a minúsculas y vuelve a deduplicar.
  • Elimina los parámetros de seguimiento con un limpiador UTM antes de archivar, o terminarás con decenas de casi duplicados.
  • Verifica el estado. Pasa la lista por un comprobador de enlaces rotos para descartar los 404 antes de darla por buena.

Preguntas frecuentes

Solo cuando el enlace corto está escrito con el esquema completo. bit.ly/xyz solo no se captura, pero https://bit.ly/xyz se trata como una URL normal. El extractor no sigue redirecciones; resuélvelas por separado si necesitas el destino final.

Sí, cuando el href es una URL http:// o https:// completa. El valor se extrae limpiamente sin la etiqueta circundante; los href relativos no se capturan.

Se conservan tal cual. Si quieres eliminar utm_* y parámetros de seguimiento similares, usa un limpiador de URLs después de la extracción.

No. El texto se procesa durante la solicitud y el contenido no se persiste ni se registra.

Herramientas relacionadas

Herramienta disponible en otros idiomas