Handleiding voor het extraheren van bestandslinks
Hoe bestandlinks te extraheren uit HTML of een webpagina
Krijg een schone lijst van afbeeldingen, PDF- en andere bestands-URL's van webpage HTML. Kies tussen het scannen van de live pagina met GrabAll en het extraheren van links uit geplakte HTML of tekst met de gratis online tools.
Kies tussen het scannen van een pagina en het parseren van geplakte HTML
Het scannen van een geladen webpagina kan bestanden vinden die in de browser beschikbaar zijn, terwijl de online extractor alleen de HTML of tekst leest die je plakt. Kies de methode die bij je startpunt past en bekijk vervolgens de resulterende URL's voordat je ze gebruikt om te downloaden.
Waar URL's in HTML staan
Links gebruiken href, media meestal src, responsieve afbeeldingen srcset en lazy-load bibliotheken data-attributen.
Relatieve paden oplossen
Een pad als ../files/report.pdf wordt pas volledig met de oorspronkelijke pagina-URL. Controleer daarna het domein.
Kandidaten filteren
Broncode bevat ook navigatie, API's, analyse, lettertypen, scripts en tracking. Filter op relevante extensies.
Valideren voor download
Verwijder duplicaten, controleer domeinen en test een kleine steekproef. Een extensie garandeert geen geldig of toegestaan bestand.
Veelgestelde vragen
Kan de tool ../-paden oplossen?
Ja, met de oorspronkelijke pagina-URL als basis.
Worden srcset-afbeeldingen gevonden?
Ja, gangbare bron- en responsieve attributen worden gecontroleerd.
Waarom ontbreken live bestanden?
JavaScript kan ze pas later of na interactie toevoegen.
Zijn alle URL's veilig?
Nee, controleer domein, type, toestemming en een steekproef.