GrabAll
Ръководство за извличане на връзка към HTML файл

Как да извлечете връзки към файлове от HTML или уеб страница

Вземете чист списък с URL адреси на изображения, PDF и други файлове от HTML на уеб страница. Изберете между сканиране на страницата на живо с GrabAll и извличане на връзки от поставен HTML или текст с безплатните онлайн инструменти.

Добавяне към Chrome Добавяне към Edge Добавяне към Firefox
Файлови връзки, извлечени от HTML източник

Бърз отговор: За уеб страница на живо, сканирайте с GrabAll и копирайте откритите файлови връзки. За запазен HTML или копиран изходен код, поставете го в Bulk File URL Extractor. Предоставете основен URL адрес, когато източникът съдържа относителни връзки.

Изберете между сканиране на страница и анализ на поставен HTML

Сканирането на заредена уеб страница може да намери налични файлове в браузъра, докато онлайн екстракторът чете само HTML или текста, който поставяте. Изберете метода, който съответства на вашата начална точка, след което прегледайте получените URL адреси, преди да ги използвате за изтегляне.

Къде се появяват URL адресите на файлове в HTML

Обикновените връзки използват href, докато изображенията и медиите обикновено използват src. Отзивчивите изображения могат да изброяват няколко кандидата в srcset. Библиотеките с отложено зареждане често съхраняват реални URL адреси в data-src, data-original или потребителски атрибути на данни.

Стиловите таблици и вграденият CSS може да препращат към фонове чрез url(). Необработеният текст може също да съдържа пълни URL адреси, които не са прикачени към HTML елемент.

Разрешете правилно относителните пътища

Стойност като ../files/report.pdf има значение само по отношение на страницата, от която идва HTML. Предоставете URL адреса на оригиналната страница като основа, така че инструментът за извличане да може да превърне относителните пътища в пълни адреси.

Връзки, свързани с протокол, започващи с // обикновено наследяват HTTPS на защитена страница. Относителните пътища, започващи с /, използват текущия произход на уебсайта.

Филтриране на кандидат URL адреси по предназначение

Не всеки URL адрес в изходния код е актив за изтегляне. Страниците съдържат връзки за навигация, API, анализи, шрифтове, скриптове, таблици със стилове и параметри за проследяване. Филтрирайте по подходящи разширения и проверете двусмислените URL адреси.

За изображения включете модерни формати като WebP и AVIF. За документи помислете за PDF, DOCX, XLSX, CSV, PPTX и архиви според задачата.

HTML източник спрямо изобразената страница

Копираният източник представлява само това, което сте предоставили. Може да пропусне ресурси, вмъкнати след изпълнение на JavaScript, съдържание, заредено след превъртане, или URL адреси, създадени по време на взаимодействие.

Използвайте офлайн екстрактора за изходни фрагменти, експортиран HTML, имейл шаблони и преглед на кода. Използвайте разширението GrabAll за изобразената на живо страница и работните процеси в контекста на браузъра.

Потвърдете преди изтегляне

Дедупликирайте списъка, проверете домейни и тествайте малка извадка. Съвпадащото разширение в URL не гарантира, че отговорът е валиден или че сте упълномощени да го използвате.

Избягвайте автоматичното изискване на големи непрегледани списъци. Валидирането предотвратява повредени връзки, нежелани крайни точки за проследяване и ненужно натоварване.

Често задавани въпроси

Може ли екстракторът да разреши ../ относителни връзки?

Да, когато предоставите URL на оригиналната страница като основен адрес.

Извличането на HTML включва ли srcset изображения?

Инструментът GrabAll проверява общите атрибути на източника и адаптивното изображение, включително кандидати за srcset.

Защо някои файлове на живи страници липсват в копирания HTML?

JavaScript може да ги добави след първоначалното зареждане на HTML. Използвайте разширението на браузъра на живо за визуализирано и динамично заредено съдържание на страници.

Всички извлечени URL адреси безопасни ли са за изтегляне?

Не. Прегледайте домейни, файлови типове, разрешения и малка извадка, преди да използвате списък с резултати.

Намерете още файлове. Изтеглете ги с по-малко работа.

GrabAll сканира страницата и поставя изображения, документи, медии и други файлове за изтегляне в един ясен списък, така че можете да изберете точно какво да запазите.

Добавяне към Chrome Добавяне към Edge Добавяне към Firefox