Respuesta rápida: Para una página web en vivo, escanéala con GrabAll y copia los enlaces de archivos detectados. Para HTML guardado o código fuente copiado, pégalo en el Extractor Masivo de URLs de Archivos. Proporciona una URL base cuando la fuente contenga enlaces relativos.
Elige entre escanear una página o analizar HTML pegado
Escanear una página web cargada puede encontrar archivos disponibles en el navegador, mientras que el extractor en línea solo lee el HTML o el texto que pegues. Elige el método que coincida con tu punto de partida y luego revisa las URL resultantes antes de usarlas para descargas.
Dónde aparecen las URL de archivos en HTML
Los enlaces ordinarios usan href, mientras que las imágenes y los medios utilizan comúnmente src. Las imágenes responsivas pueden enumerar a varios candidatos en srcset. Las bibliotecas de carga lenta suelen almacenar URLs real en datos-src, data-original o atributos de datos personalizados.
Fichas de estilo y CSS en lÃnea pueden hacer referencia a los antecedentes a través de url(). El texto bruto también puede contener URLs completo que no se adjuntan a un elemento HTML. Soporte
- Extractor
- atributos src y poster
- srcset y candidatos de data-srcset
- CSS url() y valores absolutos brutos URLs
Resuelve correctamente las rutas relativas
Una ruta como ../files/report.pdf solo tiene sentido en relación con la página de la que procede el HTML. Indica la URL de la página original como base para que el extractor convierta las rutas relativas en direcciones completas.
Enlaces relacionados con protocolo que comienzan con // normalmente heredan HTTPS en una página segura. Rutas relativas de raÃz que comienzan con / utilizar el origen actual del sitio web.
- Mantenga la página de origen original URL
- Ãsalo como base URL
- Normalizar los caminos relativos y relativos del protocolo
- Revise los dominios resueltos antes de utilizar la lista
Filtra las URL candidatas según el objetivo
No todos los URL en código fuente es un activo descargable. Las páginas contienen enlaces de navegación, APIs, análisis, fuentes, scripts, hojas de estilo y parámetros de seguimiento. Filtro por extensiones relevantes e inspeccionar ambiguo URLs.
Para imágenes, incluye formatos modernos como WebP y AVIF. Para documentos, considere PDF, DOCX, XLSX, CSV, PPTX, y archivos según la tarea.
HTML frente a la página renderizada
La fuente copiada representa sólo lo que suministraste. Puede perder recursos insertados después de las carreras JavaScript, contenido cargado después de desplazamiento, o URLs creada durante la interacción.
Utilice el extractor sin conexión para fragmentos de fuente, HTML exportado, plantillas de correo electrónico y revisión de código. Utilice la extensión GrabAll para la página renderizada en vivo y los flujos de trabajo contexto navegador.
Comprueba los enlaces antes de descargar
Deduplicar la lista, inspeccionar dominios y probar una pequeña muestra. Una extensión coincidente en un URL no garantiza que la respuesta sea válida o que esté autorizado a utilizarla.
Evite solicitar automáticamente listas grandes sin revisión. La validación evita los enlaces rotos, los puntos finales de seguimiento no deseados y la carga innecesaria.
Preguntas frecuentes
¿Puede el extractor resolver ../ enlaces relativos?
SÃ, cuando proporcione la página original URL como la dirección base.
¿Extracción HTML incluye imágenes srcset?
La herramienta GrabAll comprueba los atributos de fuente común y de imagen receptiva, incluidos los candidatos srcset.
¿Por qué faltan algunos archivos de página en vivo de la copiada HTML?
JavaScript puede agregarlos después de las cargas iniciales HTML. Utilice la extensión del navegador en vivo para el contenido de página renderizado y cargado dinámicamente.
¿Están todos extraÃdos URLs seguro para descargar?
No. Revise dominios, tipos de archivos, permisos y una pequeña muestra antes de usar una lista de resultados.
GrabAll analiza la página y reúne imágenes, documentos, archivos multimedia y otros archivos descargables en una lista clara para que elijas exactamente qué guardar.