GrabAll

Handleiding voor het extraheren van bestandslinks

Hoe bestandlinks te extraheren uit HTML of een webpagina

Krijg een schone lijst van afbeeldingen, PDF- en andere bestands-URL's van webpage HTML. Kies tussen het scannen van de live pagina met GrabAll en het extraheren van links uit geplakte HTML of tekst met de gratis online tools.

Toevoegen aan Chrome Toevoegen aan Edge Toevoegen aan Firefox Binnenkort beschikbaar

Kies tussen het scannen van een pagina en het parseren van geplakte HTML

Het scannen van een geladen webpagina kan bestanden vinden die in de browser beschikbaar zijn, terwijl de online extractor alleen de HTML of tekst leest die je plakt. Kies de methode die bij je startpunt past en bekijk vervolgens de resulterende URL's voordat je ze gebruikt om te downloaden.

Waar URL's in HTML staan

Links gebruiken href, media meestal src, responsieve afbeeldingen srcset en lazy-load bibliotheken data-attributen.

Relatieve paden oplossen

Een pad als ../files/report.pdf wordt pas volledig met de oorspronkelijke pagina-URL. Controleer daarna het domein.

Kandidaten filteren

Broncode bevat ook navigatie, API's, analyse, lettertypen, scripts en tracking. Filter op relevante extensies.

Valideren voor download

Verwijder duplicaten, controleer domeinen en test een kleine steekproef. Een extensie garandeert geen geldig of toegestaan bestand.

Veelgestelde vragen

Kan de tool ../-paden oplossen?

Ja, met de oorspronkelijke pagina-URL als basis.

Worden srcset-afbeeldingen gevonden?

Ja, gangbare bron- en responsieve attributen worden gecontroleerd.

Waarom ontbreken live bestanden?

JavaScript kan ze pas later of na interactie toevoegen.

Zijn alle URL's veilig?

Nee, controleer domein, type, toestemming en een steekproef.