Respuesta rápida: Pegue el HTML en GrabAll de Extractor de URL de archivos, suministra la página de origen como base URL cuando existen caminos relativos, extrae los candidatos, luego filtra y valida la lista de resultados. Utilice la extensión en vivo en su lugar cuando el contenido se añade después de las cargas iniciales HTML. Pagos
Dónde aparecen las URL de archivos en HTML
Los enlaces ordinarios usan href, mientras que las imágenes y los medios utilizan comúnmente src. Las imágenes responsivas pueden enumerar a varios candidatos en srcset. Las bibliotecas de carga lenta suelen almacenar URLs real en datos-src, data-original o atributos de datos personalizados.
Fichas de estilo y CSS en línea pueden hacer referencia a los antecedentes a través de url(). El texto bruto también puede contener URLs completo que no se adjuntan a un elemento HTML. Soporte
- Extractor
- atributos src y poster
- srcset y candidatos de data-srcset
- CSS url() y valores absolutos brutos URLs
Resuelve correctamente las rutas relativas
Una ruta como ../files/report.pdf solo tiene sentido en relación con la página de la que procede el HTML. Indica la URL de la página original como base para que el extractor convierta las rutas relativas en direcciones completas.
Enlaces relacionados con protocolo que comienzan con // normalmente heredan HTTPS en una página segura. Rutas relativas de raíz que comienzan con / utilizar el origen actual del sitio web.
- Mantenga la página de origen original URL
- Úsalo como base URL
- Normalizar los caminos relativos y relativos del protocolo
- Revise los dominios resueltos antes de utilizar la lista
Filtra las URL candidatas según el objetivo
No todos los URL en código fuente es un activo descargable. Las páginas contienen enlaces de navegación, APIs, análisis, fuentes, scripts, hojas de estilo y parámetros de seguimiento. Filtro por extensiones relevantes e inspeccionar ambiguo URLs.
Para imágenes, incluye formatos modernos como WebP y AVIF. Para documentos, considere PDF, DOCX, XLSX, CSV, PPTX, y archivos según la tarea.
HTML frente a la página renderizada
La fuente copiada representa sólo lo que suministraste. Puede perder recursos insertados después de las carreras JavaScript, contenido cargado después de desplazamiento, o URLs creada durante la interacción.
Utilice el extractor sin conexión para fragmentos de fuente, HTML exportado, plantillas de correo electrónico y revisión de código. Utilice la extensión GrabAll para la página renderizada en vivo y los flujos de trabajo contexto navegador.
Comprueba los enlaces antes de descargar
Deduplicar la lista, inspeccionar dominios y probar una pequeña muestra. Una extensión coincidente en un URL no garantiza que la respuesta sea válida o que esté autorizado a utilizarla.
Evite solicitar automáticamente listas grandes sin revisión. La validación evita los enlaces rotos, los puntos finales de seguimiento no deseados y la carga innecesaria.
Preguntas frecuentes
¿Puede el extractor resolver ../ enlaces relativos?
Sí, cuando proporcione la página original URL como la dirección base.
¿Extracción HTML incluye imágenes srcset?
La herramienta GrabAll comprueba los atributos de fuente común y de imagen receptiva, incluidos los candidatos srcset.
¿Por qué faltan algunos archivos de página en vivo de la copiada HTML?
JavaScript puede agregarlos después de las cargas iniciales HTML. Utilice la extensión del navegador en vivo para el contenido de página renderizado y cargado dinámicamente.
¿Están todos extraídos URLs seguro para descargar?
No. Revise dominios, tipos de archivos, permisos y una pequeña muestra antes de usar una lista de resultados.
Utiliza GrabAll únicamente con archivos a los que tengas permiso para acceder y descargar. La extensión ayuda a descubrir y organizar recursos de páginas web expuestas; no evita la autenticación, muros de pago, DRM, contenido privado, derechos de autor o reglas del sitio web.