GrabAll
Guide för extrahering av HTML-fillänkar

Hur man extraherar fillänkar från HTML eller en webbsida

Få en ren lista med bild-, PDF- och andra fil-URL:er från webbplatsens HTML. Välj mellan att skanna den live sidan med GrabAll eller extrahera länkar från inklistrad HTML eller text med gratis onlineverktygen.

Lägg till i Chrome Lägg till i Edge Lägg till i Firefox
Fil-länkar extraherade från HTML-källa

Snabbt svar: För en live-webbsida, skanna med GrabAll och kopiera de upptäckta fil-länkarna. För sparad HTML eller kopierad källkod, klistra in den i Bulk File URL Extractor. Ange en bas-URL när källan innehåller relativa länkar.

Välj mellan att skanna en sida och att analysera inklistrad HTML

Att skanna en laddad webbsida kan hitta filer som är tillgängliga i webbläsaren, medan den online-extraktorn endast läser HTML eller text som du klistrar in. Välj metoden som matchar din utgångspunkt, och granska sedan de resulterande URL:erna innan du använder dem för nedladdningar.

Var fil-URL:er dyker upp i HTML

Vanliga länkar använder href, medan bilder och media vanligtvis använder src. Responsiva bilder kan lista flera alternativ i srcset. Lazy-loading-bibliotek lagrar ofta verkliga URL:er i data-src, data-original eller anpassade data-attribut.

Stilmallar och inline CSS kan referera till bakgrunder via url(). Ofiltrerad text kan också innehålla kompletta URL:er som inte är kopplade till ett HTML-element.

Lös relativa sökvägar korrekt

Ett värde som ../files/report.pdf är meningsfullt endast i förhållande till sidan där HTML kom ifrån. Ange den ursprungliga sidans URL som bas så att extraktorn kan omvandla relativa sökvägar till kompletta adresser.

Protokoll-relativa länkar som börjar med // är normaltvsäkra på en HTTPS-sida. Rotrelativa sökvägar som börjar med / använder den aktuella webbplatsens ursprung.

Filtrera kandidat-URL:er efter avsikt

Inte varje URL i källkoden är en nedladdningsbar tillgång. Sidor innehåller navigationslänkar, API:er, analysdata, typsnitt, skript, stilmallar och spårningsparametrar. Filtrera efter relevanta tillägg och inspektera tveksamma URL:er.

För bilder, inkludera moderna format som WebP och AVIF. För dokument, överväg PDF, DOCX, XLSX, CSV, PPTX och arkiv enligt uppgiften.

HTML-källa versus den renderade sidan

Kopierad källa representerar endast det du tillhandahöll. Den kan sakna resurser som sätts in efter att JavaScript körs, innehåll som laddas efter scrollning, eller URL:er skapade under interaktion.

Använd offline-extraktorn för källutdrag, exporterad HTML, e-postmallar och kodgranskning. Använd GrabAll-tillägget för den live-renderade sidan och arbetsflöden i webbläsarkontext.

Validera innan nedladdning

Ta bort dubbletter från listan, inspektera domäner och testa ett litet urval. En matchande filändelse i en URL garanterar inte att svaret är giltigt eller att du har rätt att använda det.

Undvik att automatiskt begära stora ogranskade listor. Validering förhindrar brutna länkar, oönskade spårningsändpunkter och onödig belastning.

Vanliga frågor

Kan extraheringsverktyget lösa ../ relativa länkar?

Ja, när du anger den ursprungliga sidans URL som basadress.

Inkluderar HTML-extraktion srcset-bilder?

GrabAll-verktyget kontrollerar attribut för vanliga källor och responsiva bilder, inklusive srcset-kandidater.

Varför saknas vissa filer från live-sidan i kopierad HTML?

JavaScript kan lägga till dem efter att den initiala HTML har laddats. Använd live webbläsartillägget för renderat och dynamiskt laddat sidinnehåll.

Är alla extraherade URL:er säkra att ladda ner?

Nej. Granska domäner, filtyper, behörigheter och ett litet urval innan du använder resultatlistan.

Hitta fler filer. Ladda ner dem med mindre arbete.

GrabAll skannar sidan och samlar bilder, dokument, media och andra nedladdningsbara filer i en tydlig lista, så att du kan välja exakt vad som ska sparas.

Lägg till i Chrome Lägg till i Edge Lägg till i Firefox