GrabAll
Guida all'estrazione dei link di file dall'HTML

Come estrarre link dei file da HTML o da una pagina web

Ottieni un elenco pulito di URL di immagini, PDF e altri file da HTML di una pagina web. Scegli tra scansionare la pagina live con GrabAll ed estrarre i link da HTML o testo incollato con gli strumenti online gratuiti.

Aggiungi a Chrome Aggiungi a Edge Aggiungi a Firefox
Link dei file estratti dal codice sorgente HTML

Risposta rapida: Per una pagina web live, scansiona con GrabAll e copia i link dei file rilevati. Per HTML salvato o codice sorgente copiato, incollalo nel Bulk File URL Extractor. Fornisci un URL base quando il codice sorgente contiene link relativi.

Scegli tra scansionare una pagina e analizzare HTML incollato

La scansione di una pagina web caricata può trovare file disponibili nel browser, mentre l'estrattore online legge solo l'HTML o il testo che incolli. Scegli il metodo che corrisponde al tuo punto di partenza, quindi rivedi gli URL risultanti prima di usarli per i download.

Dove compaiono gli URL dei file in HTML

I link ordinari usano href, mentre immagini e media comunemente usano src. Le immagini responsive possono elencare diversi candidati in srcset. Le librerie di lazy-loading spesso memorizzano gli URL reali in data-src, data-original o attributi dati personalizzati.

I fogli di stile e il CSS inline possono fare riferimento ai background tramite url(). Anche il testo grezzo può contenere URL completi che non sono associati a un elemento HTML.

Risolvi correttamente i percorsi relativi

Un valore come ../files/report.pdf ha significato solo in relazione alla pagina da cui proviene l'HTML. Fornisci l'URL della pagina originale come base in modo che l'estrattore possa trasformare i percorsi relativi in indirizzi completi.

I link relativi al protocollo che iniziano con // normalmente ereditano HTTPS su una pagina sicura. I percorsi relativi alla root che iniziano con / utilizzano l'origine del sito web corrente.

Filtra URL candidati per intento

Non ogni URL nel codice sorgente è un file scaricabile. Le pagine contengono link di navigazione, API, analitiche, font, script, fogli di stile e parametri di tracciamento. Filtra per estensioni rilevanti e analizza URL ambigui.

Per le immagini, includi formati moderni come WebP e AVIF. Per i documenti, considera PDF, DOCX, XLSX, CSV, PPTX e archivi secondo il compito.

Sorgente HTML versus pagina renderizzata

Sorgente copiato rappresenta solo ciò che hai fornito. Potrebbe perdere risorse inserite dopo l'esecuzione di JavaScript, contenuti caricati dopo lo scorrimento o URL creati durante l'interazione.

Usa l'estrattore offline per frammenti di codice sorgente, HTML esportato, modelli di email e revisione del codice. Usa l'estensione GrabAll per la pagina renderizzata in tempo reale e i flussi di lavoro basati sul contesto del browser.

Valida prima del download

Deduplica la lista, ispeziona i domini e testa un piccolo campione. Un'estensione corrispondente in un URL non garantisce che la risposta sia valida o che tu sia autorizzato a usarla.

Evita di richiedere automaticamente liste non revisionate di grandi dimensioni. La validazione previene link rotti, endpoint di tracciamento indesiderati e carichi inutili.

Domande frequenti

L'estrattore può risolvere link relativi ../?

Sì, quando fornisci l'URL originale della pagina come indirizzo base.

L'estrazione HTML include le immagini srcset?

Lo strumento GrabAll verifica attributi comuni delle sorgenti e delle immagini responsive, inclusi i candidati srcset.

Perché alcuni file di pagine live mancano nell'HTML copiato?

JavaScript può aggiungerli dopo il caricamento iniziale dell'HTML. Usa l'estensione del browser in tempo reale per contenuti della pagina resi e caricati dinamicamente.

Tutti gli URL estratti sono sicuri da scaricare?

No. Controlla domini, tipi di file, permessi e un piccolo campione prima di usare una lista di risultati.

Trova più file. Scaricali con meno lavoro.

GrabAll scansiona la pagina e raccoglie immagini, documenti, media e altri file scaricabili in un'unica lista chiara, così puoi scegliere esattamente cosa salvare.

Aggiungi a Chrome Aggiungi a Edge Aggiungi a Firefox