Snabbt svar: För en live-webbsida, skanna med GrabAll och kopiera de upptäckta fil-länkarna. För sparad HTML eller kopierad källkod, klistra in den i Bulk File URL Extractor. Ange en bas-URL när källan innehåller relativa länkar.
Välj mellan att skanna en sida och att analysera inklistrad HTML
Att skanna en laddad webbsida kan hitta filer som är tillgängliga i webbläsaren, medan den online-extraktorn endast läser HTML eller text som du klistrar in. Välj metoden som matchar din utgångspunkt, och granska sedan de resulterande URL:erna innan du använder dem för nedladdningar.
Var fil-URL:er dyker upp i HTML
Vanliga länkar använder href, medan bilder och media vanligtvis använder src. Responsiva bilder kan lista flera alternativ i srcset. Lazy-loading-bibliotek lagrar ofta verkliga URL:er i data-src, data-original eller anpassade data-attribut.
Stilmallar och inline CSS kan referera till bakgrunder via url(). Ofiltrerad text kan också innehålla kompletta URL:er som inte är kopplade till ett HTML-element.
- href-länkar
- src och poster-attribut
- srcset- och data-srcset-kandidater
- CSS url()-värden och rena absoluta URL:er
Lös relativa sökvägar korrekt
Ett värde som ../files/report.pdf är meningsfullt endast i förhållande till sidan där HTML kom ifrån. Ange den ursprungliga sidans URL som bas så att extraktorn kan omvandla relativa sökvägar till kompletta adresser.
Protokoll-relativa länkar som börjar med // är normaltvsäkra på en HTTPS-sida. Rotrelativa sökvägar som börjar med / använder den aktuella webbplatsens ursprung.
- Behåll den ursprungliga källsidans URL
- Använd det som bas-URL
- Normalisera protokollrelativa och rotrelativa sökvägar
- Granska de lösta domänerna innan du använder listan
Filtrera kandidat-URL:er efter avsikt
Inte varje URL i källkoden är en nedladdningsbar tillgång. Sidor innehåller navigationslänkar, API:er, analysdata, typsnitt, skript, stilmallar och spårningsparametrar. Filtrera efter relevanta tillägg och inspektera tveksamma URL:er.
För bilder, inkludera moderna format som WebP och AVIF. För dokument, överväg PDF, DOCX, XLSX, CSV, PPTX och arkiv enligt uppgiften.
HTML-källa versus den renderade sidan
Kopierad källa representerar endast det du tillhandahöll. Den kan sakna resurser som sätts in efter att JavaScript körs, innehåll som laddas efter scrollning, eller URL:er skapade under interaktion.
Använd offline-extraktorn för källutdrag, exporterad HTML, e-postmallar och kodgranskning. Använd GrabAll-tillägget för den live-renderade sidan och arbetsflöden i webbläsarkontext.
Validera innan nedladdning
Ta bort dubbletter från listan, inspektera domäner och testa ett litet urval. En matchande filändelse i en URL garanterar inte att svaret är giltigt eller att du har rätt att använda det.
Undvik att automatiskt begära stora ogranskade listor. Validering förhindrar brutna länkar, oönskade spårningsändpunkter och onödig belastning.
Vanliga frågor
Kan extraheringsverktyget lösa ../ relativa länkar?
Ja, när du anger den ursprungliga sidans URL som basadress.
Inkluderar HTML-extraktion srcset-bilder?
GrabAll-verktyget kontrollerar attribut för vanliga källor och responsiva bilder, inklusive srcset-kandidater.
Varför saknas vissa filer från live-sidan i kopierad HTML?
JavaScript kan lägga till dem efter att den initiala HTML har laddats. Använd live webbläsartillägget för renderat och dynamiskt laddat sidinnehåll.
Är alla extraherade URL:er säkra att ladda ner?
Nej. Granska domäner, filtyper, behörigheter och ett litet urval innan du använder resultatlistan.
GrabAll skannar sidan och samlar bilder, dokument, media och andra nedladdningsbara filer i en tydlig lista, så att du kan välja exakt vad som ska sparas.