Réponse rapide : Collez le HTML dans le fichier GrabAll gratuit en masse URL Extractor, fournir la page source comme base URL lorsque des chemins relatifs sont présents, extraire les candidats, puis filtrer et valider la liste de résultats. Utilisez plutôt l'extension live lorsque le contenu est ajouté après les charges initiales de HTML. Paiements
Où trouver les URL de fichiers dans le HTML
Les liens ordinaires utilisent href, tandis que les images et les médias utilisent généralement src. Les images réactives peuvent lister plusieurs candidats dans srcset. Les bibliothèques de chargement lazy stockent souvent des attributs de données réels URL dans data-src, data-original ou sur mesure.
et CSS en ligne peuvent faire référence aux arrière-plans via url(). Le texte brut peut également contenir URL complet qui ne sont pas attachés à un élément HTML. Prise en charge
- Liens href
- src et poster
- candidats srcset et données-srcset
- CSS url() valeurs brutes absolues URL
Résoudre correctement les chemins relatifs
Une valeur telle que ../files/report.pdf n'est significative que par rapport à la page d'origine du HTML. Fournissez la page originale URL comme base pour que l'extracteur puisse transformer les chemins relatifs en adresses complètes.
Les liens protocolaires commençant par // héritent normalement de HTTPS sur une page sécurisée. chemins root-relative commençant par / utiliser l'origine actuelle du site.
- Conserver la page source d'origine URL
- Utilisez-le comme base URL
- Normaliser les chemins protocolaires et racinaires
- Examiner les domaines résolus avant d'utiliser la liste
Filtrez les URL selon votre objectif
Tous les URL du code source ne sont pas téléchargeables. Les pages contiennent des liens de navigation, API, des analyses, des polices, des scripts, des feuilles de style et des paramètres de suivi. Filtrer par les extensions pertinentes et inspecter le URL ambigu.
Pour les images, inclure des formats modernes tels que WebP et AVIF. Pour les documents, considérer PDF, DOCX, XLSX, CSV, PPTX, et les archives selon la tâche.
Code HTML ou page affichée
La source copiée ne représente que ce que vous avez fourni. Il peut manquer les ressources insérées après que JavaScript fonctionne, le contenu chargé après défilement, ou URL créé pendant l'interaction.
Utilisez l'extracteur hors ligne pour les extraits de source, les modèles HTML exportés, les modèles de courriel et la revue de code. Utilisez l'extension GrabAll pour les flux de travail en direct de la page et du contexte du navigateur.
Vérifiez les liens avant de télécharger
Dupliquer la liste, inspecter les domaines et tester un petit échantillon. Une extension correspondante dans une URL ne garantit pas que la réponse est valide ou que vous êtes autorisé à l'utiliser.
Évitez de demander automatiquement de grandes listes non revues. La validation empêche les liens rompus, les paramètres de suivi indésirables et la charge inutile.
Questions fréquentes
L'extracteur peut-il résoudre ../ liens relatifs?
Oui, lorsque vous fournissez la page d'origine URL comme adresse de base.
L'extraction HTML inclut-elle des images srcset ?
L'outil GrabAll vérifie les attributs communs source et image réactive, y compris les candidats srcset.
Pourquoi certains fichiers de page en direct absents de HTML copiés?
JavaScript peut les ajouter après les charges initiales HTML. Utilisez l'extension de navigateur en direct pour le contenu de page rendu et chargé dynamiquement.
Est-ce que toutes les URL extraites sont sécurisés à télécharger ?
Non. Examiner les domaines, les types de fichiers, les permissions et un petit échantillon avant d'utiliser une liste de résultats.
Utilisez GrabAll pour les fichiers que vous pouvez accéder et télécharger. L'extension permet de découvrir et d'organiser des ressources de pages web exposées ; elle ne contourne pas l'authentification, les paywalls, DRM, le contenu privé, les droits d'auteur ou les règles du site web.