Extractor de enlaces externos

Pega HTML en bruto y obtén una lista limpia y sin duplicados de todos los enlaces externos que contiene. Opcionalmente, introduce una URL base para que el extractor sepa qué host cuenta como interno; se reportarán los enlaces a cualquier otro host. Útil al auditar un sitio por fugas de enlaces, colocaciones de socios obsoletas o para comprobar que los enlaces salientes van a donde exige tu política.

Cómo extraer enlaces externos

  1. 1

    Proporciona la fuente

    Pega el HTML en bruto de la página. Opcionalmente, añade una URL base para que el extractor sepa qué host cuenta como interno; déjala vacía para tratar todos los hosts como externos.

  2. 2

    Ejecutar la extracción

    Se lee cada `<a href>` y solo se conservan los enlaces absolutos http/https cuyo host difiere del host base. Se eliminan los duplicados.

  3. 3

    Revisar la lista

    Obtienes una URL externa por línea, lista para pegar en una hoja de cálculo o para verificar enlaces individuales.

  4. 4

    Usar el resultado

    Copia la lista al portapapeles o mantén la página abierta mientras compruebas cada destino en una pestaña nueva.

Lo que el extractor considera externo

Un enlace es externo cuando su host difiere de la URL base que proporcionaste (la comparación no distingue mayúsculas de minúsculas). Los subdominios cuentan como hosts separados, así que blog.example.com es externo respecto a www.example.com. Si quieres auditar todo el subdominio, elimina el subdominio de tu URL base. Deja la URL base vacía para listar todos los enlaces http/https como externos.

El extractor solo reporta las URLs de destino. No lee el texto de anclaje ni los atributos rel; audita los tokens nofollow, ugc y sponsored directamente en el HTML de origen.

Lo que ignora

  • mailto:, tel:, javascript: y hrefs solo de fragmento #.
  • URLs relativas y URLs relativas al protocolo, como //cdn.example.com (conviértelas en URLs absolutas en el HTML pegado si quieres que se cuenten).
  • Etiquetas de anclaje sin href (no son enlaces navegables).

Consejos

  • Pega el HTML renderizado si la página usa JavaScript. Los enlaces que un framework genera en el cliente solo aparecen cuando pegas el DOM renderizado (por ejemplo, copia el outerHTML desde DevTools).
  • Cuidado con los envoltorios de seguimiento. Las redirecciones de afiliados a través de /go/ o /out/ ocultan el destino real; el extractor devuelve la URL del envoltorio tal cual, así que inspecciona el href en bruto cuando un destino parezca sospechoso.
  • Normaliza antes de comparar. Una URL con un fragmento o un parámetro de seguimiento distinto cuenta como un enlace aparte; normaliza las URLs antes de comparar dos ejecuciones del extractor.
  • Compara a lo largo del tiempo. Ejecuta el extractor mensualmente y compara las listas; los enlaces externos nuevos que no añadiste son la primera señal de un tema o plugin comprometido.

Preguntas frecuentes

Extrae el href exactamente como está escrito en el HTML. Seguir cada redirección ralentizaría drásticamente el informe y puede activar protecciones contra bots en el destino; resuélvelas por separado si necesitas la URL final.

No. El extractor analiza el HTML tal como se entrega. Los enlaces que un framework renderiza en el cliente solo aparecerán si pegas el DOM renderizado (por ejemplo, copia el outerHTML desde DevTools).

Solo se reportan URLs absolutas http/https. Las URLs relativas al protocolo como //cdn.example.com, las rutas relativas y los enlaces mailto: o tel: se omiten; conviértelos en URLs absolutas en el HTML pegado si quieres que se cuenten.

El HTML que pegas se envía a nuestro servidor solo para ejecutar la extracción en la solicitud actual. No se guarda en una base de datos ni en un registro, y no se conserva nada después de que la respuesta llegue a tu navegador.

Herramientas relacionadas

Herramienta disponible en otros idiomas