Resposta rápida: Cole o HTML em GrabAll grátis Extrator de URLs de arquivos, informe a URL da página de origem como base quando os caminhos relativos estão presentes, extrair os candidatos, em seguida, filtrar e validar a lista de resultados. Use a extensão ao vivo em vez quando o conteúdo é adicionado após as cargas iniciais HTML. Pagamentos
Onde as URLs de arquivos aparecem no HTML
Links comuns usam href, enquanto imagens e mídia comumente usam src. Imagens responsivas podem listar vários candidatos em srcset. Bibliotecas de carregamento preguiçoso muitas vezes armazenam URLs reais em dados-src, dados-originais, ou atributos de dados personalizados.
Folhas de estilo e CSS em linha podem referenciar fundos através de url(). Texto bruto também pode conter URLs completas que não estão ligados a um elemento HTML. Suporte ao
- href
- atributos src e poster
- srcset e candidatos de data-srcset
- CSS url () e valores absolutos brutos URLs Modo de cálculo
Resolva os caminhos relativos corretamente
Um valor como ../files/report.pdf é significativo apenas em relação à página de onde o HTML veio. Forneça a página original URL como base para que o extrator possa transformar caminhos relativos em endereços completos.
começando com // normalmente herdar HTTPS em uma página segura. Caminhos Guias relacionados com raiz começando com / usar a origem do site atual.
- Mantenha a página original URL
- Use-o como base URL
- Normalizar caminhos Guias relacionados ao protocolo e Guias relacionados à raiz
- Revise os domínios resolvidos antes de usar a lista Direitos
Filtre as URLs por finalidade
Nem todo URL em código fonte é um ativo para download. Páginas contêm links de navegação, APIs, análise, fontes, scripts, folhas de estilo e parâmetros de rastreamento. Filtrar por extensões relevantes e inspecionar URLs ambíguo.
Para imagens, incluem formatos modernos, como WebP e AVIF. Para documentos, considere PDF, DOCX, XLSX, CSV, PPTX e arquivos de acordo com a tarefa.
HTML versus a página renderizada
O código copiado representa apenas o que você forneceu. Ele pode perder os recursos inseridos após a execução do JavaScript, o conteúdo carregado após a rolagem ou o URLs criado durante a interação.
Use o extrator offline para trechos de origem, HTML exportado, modelos de email e revisão de código. Use a extensão GrabAll para os fluxos de trabalho de página renderizados ao vivo e de contexto de navegador.
Validar antes de baixar
Deduplicar a lista, inspecionar domínios e testar uma pequena amostra. Uma extensão correspondente em uma URL não garante que a resposta é válida ou que você está autorizado a usá-la.
Evite solicitar automaticamente grandes listas não revistas. Validação evita links quebrados, endpoints de rastreamento indesejados e carga desnecessária.
Perguntas frequentes
O extrator pode resolver ../ links relativos?
Sim, quando você fornece a página original URL como o endereço base.
A extração HTML inclui imagens srcset?
A ferramenta GrabAll verifica atributos de fonte comum e imagem responsiva, incluindo candidatos srcset.
Por que alguns arquivos de página ao vivo estão faltando do HTML copiado?
JavaScript pode adicioná-los após as cargas iniciais do HTML. Use a extensão do navegador ao vivo para renderizar e carregar dinamicamente o conteúdo da página.
Todos os URLs extraídos são seguros para download?
Não. Reveja domínios, tipos de arquivos, permissões e uma pequena amostra antes de usar uma lista de resultados.
Use GrabAll para arquivos que você pode acessar e baixar. A extensão ajuda a descobrir e organizar arquivos de página da web expostos; ele não ignora autenticação, paywalls, DRM, conteúdo privado, direitos autorais ou regras de site.