GrabAll
HTML

Comment extraire des liens de fichiers à partir d'un HTML ou d'une page Web

Obtenez une liste propre d'URLs d'images, de PDF et d'autres fichiers depuis le HTML d'une page Web. Choisissez entre scanner la page en direct avec GrabAll ou extraire des liens à partir d'un HTML ou texte collé avec les outils gratuits en ligne.

Ajouter à Chrome Ajouter à Edge Ajouter à Firefox Bientôt disponible
Liens de fichiers extraits de la source HTML

Réponse rapide : Pour une page Web en direct, scannez avec GrabAll et copiez les liens de fichiers détectés. Pour un HTML sauvegardé ou un code source copié, collez-le dans le Bulk File URL Extractor. Fournissez une URL de base lorsque la source contient des liens relatifs.

Choisissez entre scanner une page et analyser un HTML collé

Scanner une page Web chargée peut trouver des fichiers disponibles dans le navigateur, tandis que l'extracteur en ligne lit uniquement le HTML ou le texte que vous collez. Choisissez la méthode qui correspond à votre point de départ, puis examinez les URL obtenues avant de les utiliser pour des téléchargements.

Où trouver les URL de fichiers dans le HTML

Les liens ordinaires utilisent href, tandis que les images et les médias utilisent généralement src. Les images réactives peuvent lister plusieurs candidats dans srcset. Les bibliothèques de chargement lazy stockent souvent des attributs de données réels URL dans data-src, data-original ou sur mesure.

et CSS en ligne peuvent faire référence aux arrière-plans via url(). Le texte brut peut également contenir URL complet qui ne sont pas attachés à un élément HTML. Prise en charge

Résoudre correctement les chemins relatifs

Une valeur telle que ../files/report.pdf n'est significative que par rapport à la page d'origine du HTML. Fournissez la page originale URL comme base pour que l'extracteur puisse transformer les chemins relatifs en adresses complètes.

Les liens protocolaires commençant par // héritent normalement de HTTPS sur une page sécurisée. chemins root-relative commençant par / utiliser l'origine actuelle du site.

Filtrez les URL selon votre objectif

Tous les URL du code source ne sont pas téléchargeables. Les pages contiennent des liens de navigation, API, des analyses, des polices, des scripts, des feuilles de style et des paramètres de suivi. Filtrer par les extensions pertinentes et inspecter le URL ambigu.

Pour les images, inclure des formats modernes tels que WebP et AVIF. Pour les documents, considérer PDF, DOCX, XLSX, CSV, PPTX, et les archives selon la tâche.

Code HTML ou page affichée

La source copiée ne représente que ce que vous avez fourni. Il peut manquer les ressources insérées après que JavaScript fonctionne, le contenu chargé après défilement, ou URL créé pendant l'interaction.

Utilisez l'extracteur hors ligne pour les extraits de source, les modèles HTML exportés, les modèles de courriel et la revue de code. Utilisez l'extension GrabAll pour les flux de travail en direct de la page et du contexte du navigateur.

Vérifiez les liens avant de télécharger

Dupliquer la liste, inspecter les domaines et tester un petit échantillon. Une extension correspondante dans une URL ne garantit pas que la réponse est valide ou que vous êtes autorisé à l'utiliser.

Évitez de demander automatiquement de grandes listes non revues. La validation empêche les liens rompus, les paramètres de suivi indésirables et la charge inutile.

Questions fréquentes

L'extracteur peut-il résoudre ../ liens relatifs?

Oui, lorsque vous fournissez la page d'origine URL comme adresse de base.

L'extraction HTML inclut-elle des images srcset ?

L'outil GrabAll vérifie les attributs communs source et image réactive, y compris les candidats srcset.

Pourquoi certains fichiers de page en direct absents de HTML copiés?

JavaScript peut les ajouter après les charges initiales HTML. Utilisez l'extension de navigateur en direct pour le contenu de page rendu et chargé dynamiquement.

Est-ce que toutes les URL extraites sont sécurisés à télécharger ?

Non. Examiner les domaines, les types de fichiers, les permissions et un petit échantillon avant d'utiliser une liste de résultats.

Trouvez plus de fichiers. Téléchargez-les plus facilement.

GrabAll analyse la page et rassemble les images, documents, médias et autres fichiers téléchargeables dans une liste claire, afin que vous choisissiez précisément ce que vous souhaitez enregistrer.

Ajouter à Chrome Ajouter à Edge Ajouter à Firefox Bientôt disponible