简要说明:将 HTML 粘贴到 GrabAll 的免费文件 URL 批量提取器中。若内容包含相对路径,请填写原始页面 URL,然后提取、筛选并验证结果。动态加载的内容应使用浏览器扩展扫描。
文件 URL 在 HTML 中出现的位置
普通链接使用href,而图像和媒体通常使用src. 反应图像可以在srcset中列出几个候选者. Lazy-loading库常将真实的URL存储在数据-rc,数据-原始,或自定义的数据属性中.
样式表和内置 CSS可以通过 URl () 引用背景。 原始文本也可以包含不附加于HTML元素的完整URL.
- href 链接
- src和海报属性
- 链路和数据链路候选人
- CSS url() 值和原始绝对 URL
正确解析相对路径
./files/report.pdf等值仅相对于HTML的出处页面有意义. 将原始的页面URL作为基础提供,这样提取器就可以将相对路径转化为完整的地址.
协议 - 相对链接从// 通常在安全页面上继承 HTTPS. 从 / 使用当前网站源头开始的根相通路径。
- 保留原始源页面 URL
- 将其作为基础 URL
- 规范协议相对和根相对路径
- 在使用列表前先审查已解决域
按用途筛选候选 URL
并非源代码中的每个URL都是可下载资产. 页面包含导航链接,API,分析,字体,脚本,样式表,以及跟踪参数. 通过相关扩展过滤并检查模糊的URL.
对于图像,包括WebP和AVIF等现代格式. 对于文档,根据任务考虑PDF,DOCX,XLSX,CSV,PPTX,以及档案.
HTML 源代码与渲染后页面的区别
复制来源只代表你提供的东西. 它可能错过在 JavaScript 运行后插入的资源, 滚动后装入的内容, 或交互过程中创建的 URL。
使用离线提取器进行源片断,导出 HTML,电子邮件模板和代码审查. 使用 GrabAll 扩展用于现场渲染的页面和浏览器-文本工作流程。
下载前验证链接
复制列表,检查域,测试一个小样本. URL中的匹配扩展不能保证响应有效或授权您使用.
避免自动请求大型未经审查的清单. 验证可以防止断开的链接,不必要的跟踪终点,以及不必要的负载.
常见问题
提取器可以解析 ../ 形式的相对链接吗?
可以。填写原始页面 URL 作为基准地址后,工具即可将相对路径转换为完整链接。
HTML 提取会包含 srcset 中的图片吗?
可以。工具会检查常见的图片属性,包括 src、srcset 以及常用的延迟加载属性。
为什么复制的 HTML 缺少页面中的某些文件?
有些资源由 JavaScript 在页面加载或交互后动态加入,初始 HTML 中并不存在。此时应扫描渲染后的页面。
提取出的 URL 都可以安全下载吗?
不一定。下载前应检查域名、文件类型、访问权限,并先测试少量链接。
允许您访问和下载的文件使用 GrabAll。 扩展帮助发现和组织页面公开的网页资产;它不会绕过认证,付费墙,DRM,私人内容,版权,或网站规则.