GrabAll
HTML 文件链接提取指南

如何从 HTML 或网页中提取文件链接

从网页 HTML 获取干净的图片、PDF 及其他文件 URL 列表。可选择使用 GrabAll 扫描实时页面,或使用免费的在线工具从粘贴的 HTML 或文本中提取链接。

添加到 Chrome 添加到 Edge 添加到 Firefox 即将推出
从 HTML 来源提取的文件链接

对于实时网页,使用 GrabAll 扫描并复制检测到的文件链接。对于已保存的 HTML 或复制的源代码,将其粘贴到批量文件 URL 提取器中。如果源包含相对链接,请提供基础 URL。

可选择扫描页面或解析粘贴的 HTML

扫描已加载的网页可以找到浏览器中可用的文件,而在线提取器仅读取你粘贴的 HTML 或文本。选择与你的起点匹配的方法,然后在使用这些 URL 下载之前先检查结果。

文件 URL 在 HTML 中出现的位置

普通链接使用href,而图像和媒体通常使用src. 反应图像可以在srcset中列出几个候选者. Lazy-loading库常将真实的URL存储在数据-rc,数据-原始,或自定义的数据属性中.

样式表和内置 CSS可以通过 URl () 引用背景。 原始文本也可以包含不附加于HTML元素的完整URL.

正确解析相对路径

./files/report.pdf等值仅相对于HTML的出处页面有意义. 将原始的页面URL作为基础提供,这样提取器就可以将相对路径转化为完整的地址.

协议 - 相对链接从// 通常在安全页面上继承 HTTPS. 从 / 使用当前网站源头开始的根相通路径。

按用途筛选候选 URL

并非源代码中的每个URL都是可下载资产. 页面包含导航链接,API,分析,字体,脚本,样式表,以及跟踪参数. 通过相关扩展过滤并检查模糊的URL.

对于图像,包括WebP和AVIF等现代格式. 对于文档,根据任务考虑PDF,DOCX,XLSX,CSV,PPTX,以及档案.

HTML 源代码与渲染后页面的区别

复制来源只代表你提供的东西. 它可能错过在 JavaScript 运行后插入的资源, 滚动后装入的内容, 或交互过程中创建的 URL。

使用离线提取器进行源片断,导出 HTML,电子邮件模板和代码审查. 使用 GrabAll 扩展用于现场渲染的页面和浏览器-文本工作流程。

下载前验证链接

复制列表,检查域,测试一个小样本. URL中的匹配扩展不能保证响应有效或授权您使用.

避免自动请求大型未经审查的清单. 验证可以防止断开的链接,不必要的跟踪终点,以及不必要的负载.

常见问题

提取器可以解析 ../ 形式的相对链接吗?

可以。填写原始页面 URL 作为基准地址后,工具即可将相对路径转换为完整链接。

HTML 提取会包含 srcset 中的图片吗?

可以。工具会检查常见的图片属性,包括 src、srcset 以及常用的延迟加载属性。

为什么复制的 HTML 缺少页面中的某些文件?

有些资源由 JavaScript 在页面加载或交互后动态加入,初始 HTML 中并不存在。此时应扫描渲染后的页面。

提取出的 URL 都可以安全下载吗?

不一定。下载前应检查域名、文件类型、访问权限,并先测试少量链接。

发现更多文件,更轻松地下载。

GrabAll 会扫描页面,将图片、文档、媒体和其他可下载文件汇总到清晰的列表中,让您轻松选择真正需要保存的内容。

添加到 Chrome 添加到 Edge 添加到 Firefox 即将推出