GrabAll
HTML guía de extracción de enlaces Fuente

Cómo extraer enlaces de archivos de HTML o de una página web

Obtén una lista limpia de URLs de imágenes, PDF y otros archivos desde el HTML de una página web. Elige entre escanear la página en vivo con GrabAll o extraer enlaces desde HTML o texto pegado con las herramientas en línea gratuitas.

Añadir a Chrome Añadir a Edge Añadir a Firefox Próximamente
Enlaces de archivo extraídos de la fuente HTML

Respuesta rápida: Para una página web en vivo, escanéala con GrabAll y copia los enlaces de archivos detectados. Para HTML guardado o código fuente copiado, pégalo en el Extractor Masivo de URLs de Archivos. Proporciona una URL base cuando la fuente contenga enlaces relativos.

Elige entre escanear una página o analizar HTML pegado

Escanear una página web cargada puede encontrar archivos disponibles en el navegador, mientras que el extractor en línea solo lee el HTML o el texto que pegues. Elige el método que coincida con tu punto de partida y luego revisa las URL resultantes antes de usarlas para descargas.

Dónde aparecen las URL de archivos en HTML

Los enlaces ordinarios usan href, mientras que las imágenes y los medios utilizan comúnmente src. Las imágenes responsivas pueden enumerar a varios candidatos en srcset. Las bibliotecas de carga lenta suelen almacenar URLs real en datos-src, data-original o atributos de datos personalizados.

Fichas de estilo y CSS en línea pueden hacer referencia a los antecedentes a través de url(). El texto bruto también puede contener URLs completo que no se adjuntan a un elemento HTML. Soporte

Resuelve correctamente las rutas relativas

Una ruta como ../files/report.pdf solo tiene sentido en relación con la página de la que procede el HTML. Indica la URL de la página original como base para que el extractor convierta las rutas relativas en direcciones completas.

Enlaces relacionados con protocolo que comienzan con // normalmente heredan HTTPS en una página segura. Rutas relativas de raíz que comienzan con / utilizar el origen actual del sitio web.

Filtra las URL candidatas según el objetivo

No todos los URL en código fuente es un activo descargable. Las páginas contienen enlaces de navegación, APIs, análisis, fuentes, scripts, hojas de estilo y parámetros de seguimiento. Filtro por extensiones relevantes e inspeccionar ambiguo URLs.

Para imágenes, incluye formatos modernos como WebP y AVIF. Para documentos, considere PDF, DOCX, XLSX, CSV, PPTX, y archivos según la tarea.

HTML frente a la página renderizada

La fuente copiada representa sólo lo que suministraste. Puede perder recursos insertados después de las carreras JavaScript, contenido cargado después de desplazamiento, o URLs creada durante la interacción.

Utilice el extractor sin conexión para fragmentos de fuente, HTML exportado, plantillas de correo electrónico y revisión de código. Utilice la extensión GrabAll para la página renderizada en vivo y los flujos de trabajo contexto navegador.

Comprueba los enlaces antes de descargar

Deduplicar la lista, inspeccionar dominios y probar una pequeña muestra. Una extensión coincidente en un URL no garantiza que la respuesta sea válida o que esté autorizado a utilizarla.

Evite solicitar automáticamente listas grandes sin revisión. La validación evita los enlaces rotos, los puntos finales de seguimiento no deseados y la carga innecesaria.

Preguntas frecuentes

¿Puede el extractor resolver ../ enlaces relativos?

Sí, cuando proporcione la página original URL como la dirección base.

¿Extracción HTML incluye imágenes srcset?

La herramienta GrabAll comprueba los atributos de fuente común y de imagen receptiva, incluidos los candidatos srcset.

¿Por qué faltan algunos archivos de página en vivo de la copiada HTML?

JavaScript puede agregarlos después de las cargas iniciales HTML. Utilice la extensión del navegador en vivo para el contenido de página renderizado y cargado dinámicamente.

¿Están todos extraídos URLs seguro para descargar?

No. Revise dominios, tipos de archivos, permisos y una pequeña muestra antes de usar una lista de resultados.

Encuentra más archivos. Descárgalos con menos esfuerzo.

GrabAll analiza la página y reúne imágenes, documentos, archivos multimedia y otros archivos descargables en una lista clara para que elijas exactamente qué guardar.

Añadir a Chrome Añadir a Edge Añadir a Firefox Próximamente