जलद उत्तर: लाइव्ह वेबपृष्ठासाठी, GrabAll वापरून स्कॅन करा आणि शोधलेले फाइल लिंक कॉपी करा. जतन केलेल्या HTML किंवा कॉपी केलेल्या स्रोत कोडसाठी, ते Bulk File URL Extractor मध्ये पेस्ट करा. स्रोतामध्ये सापेक्ष लिंक असल्यास बेस URL द्या.
पृष्ठ स्कॅन करण्यामध्ये आणि पेस्ट केलेले HTML पार्स करण्यामध्ये निवडा
लोड केलेल्या वेबपृष्ठाचे स्कॅनिंग ब्राउझरमध्ये उपलब्ध फायली शोधू शकते, तर ऑनलाइन एक्स्ट्रॅक्टर फक्त तुम्ही पेस्ट केलेला HTML किंवा मजकूर वाचतो. तुमच्या सुरुवातीच्या बिंदूसाठी जुळणारी पद्धत निवडा, नंतर डाउनलोडसाठी वापरण्यापूर्वी परिणाम URL पुनरावलोकन करा.
जेथे HTML मध्ये फाईल URL दिसतात
साध्या लिंक्ससाठी href वापरले जाते, तर प्रतिमा आणि मीडिया साधारणपणे src वापरतात. प्रतिसादात्मक प्रतिमा srcset मध्ये अनेक पर्याय सूचीबद्ध करू शकतात. लेझी-लोडिंग लायब्ररी वास्तविक URLस data-src, data-original किंवा कस्टम डेटा अॅट्रिब्युटमध्ये जतन करतात.
स्टाईलशीट्स आणि इनलाइन CSS url() द्वारे पार्श्वभूमी संदर्भित करू शकतात. कच्च्या मजकुरात पूर्ण URL देखील असू शकतात जे HTML घटकाशी जोडलेले नसतात.
- href दुवे
- src आणि poster गुणधर्म
- srcset आणि data-srcset उमेदवार
- CSS url() मूल्ये आणि मूळ पूर्ण URLs
सापेक्ष मार्ग बरोबर सोडवा
एक मूल्य जसे की .. /files/report.pdf केवळ HTML ज्या पृष्ठावरून आले त्या पृष्ठाच्या सापेक्ष अर्थपूर्ण आहे. मूळ पृष्ठ URL बेस म्हणून पुरवा जेणेकरून एक्सट्रॅक्टर सापेक्ष मार्गांना पूर्ण पत्त्यांमध्ये बदलू शकेल.
// ने सुरू होणारे प्रोटोकॉल-संबंधित लिंक सामान्यतः सुरक्षित पृष्ठावर HTTPS घेतील. / ने सुरू होणारे रूट-संबंधित मार्ग चालू वेबसाइट मूळ वापरतात.
- मूळ स्रोत पृष्ठ URL ठेवा
- हे बेस URL म्हणून वापरा
- प्रोटोकॉल-सापेक्ष आणि रूट-सापेक्ष मार्ग सामान्य करा
- यादी वापरण्यापूर्वी निराकरण केलेल्या डोमेनचे पुनरावलोकन करा
उद्देशानुसार संभाव्य URL फिल्टर करा
स्त्रोत कोडमधील प्रत्येक URL डाउनलोड करण्यायोग्य मालमत्ता नाही. पृष्ठांमध्ये नेव्हिगेशन दुवे, एपीआय, विश्लेषणे, फॉन्ट, स्क्रिप्ट्स, स्टाइलशीट आणि ट्रॅकिंग पॅरामीटर्स आहेत. संबंधित विस्तारांद्वारे फिल्टर करा आणि अस्पष्ट URL तपासा.
इमेजसाठी, WebP आणि AVIF सारख्या आधुनिक फॉरमॅट्स समाविष्ट करा. दस्तऐवजासाठी, कार्यानुसार PDF, DOCX, XLSX, CSV, PPTX आणि आर्काइव्ह विचारात घ्या.
HTML स्त्रोत विरुद्ध रेंडर केलेले पृष्ठ
कॉपी केलेला स्रोत केवळ आपण पुरवलेलेच दर्शवितो. जावास्क्रिप्ट चालल्यानंतर घातलेल्या संसाधनांचा, स्क्रोल केल्यानंतर लोड केलेल्या सामग्रीचा किंवा संवादादरम्यान तयार केलेल्या URL चा समावेश हे चुकून राहू शकतो.
स्रोत स्निपेट्स, निर्यात केलेले HTML, ईमेल टेम्पलेट्स, आणि कोड पुनरावलोकनासाठी ऑफलाइन एक्स्ट्रॅक्टर वापरा. लाइव रेंडर केलेले पृष्ठ आणि ब्राउझर-संदर्भ कार्यासाठी GrabAll एक्स्टेंशन वापरा.
डाउनलोड करण्याआधी सत्यापित करा
यादी डुप्लिकेटमुक्त करा, डोमेन्स तपासा आणि लहान नमुना चाचणी करा. URL मध्ये जुळणारा एक्स्टेंशन म्हणजे प्रतिसाद वैध आहे किंवा आपण ते वापरण्यास अधिकृत आहात हे हमी नाही.
मोठ्या न तपासलेल्या यादी स्वयंचलितपणे विनंती करण्यास टाळा. प्रमाणीकरणामुळे तुटलेल्या दुव्यांना, नको असलेले ट्रॅकिंग एंडपॉइंट्स आणि अनावश्यक लोड टाळता येतो.
वारंवार विचारले जाणारे प्रश्न
एक्स्ट्रॅक्टर ../ सापेक्ष लिंक निराकरण करू शकतो का?
होय, जेव्हा आपण मूळ पृष्ठ URL मूळ पत्ता म्हणून प्रदान करता.
HTML काढणीमध्ये srcset इमेजेस समाविष्ट आहेत का?
GrabAll साधन सामान्य स्रोत आणि प्रतिसाद-प्रतिमा गुणधर्म तपासतो, त्यात srcset उमेदवार यांचा समावेश आहे.
कॉपी केलेल्या HTML मधून काही लाइव्ह-पेज फायली गहाळ का आहेत?
जावास्क्रिप्ट प्रारंभिक एचटीएमएल लोड झाल्यानंतर त्यांना जोडू शकते. रेंडर केलेल्या आणि डायनॅमिकली लोड केलेल्या पृष्ठ सामग्रीसाठी थेट ब्राउझर विस्तार वापरा.
सर्व एक्स्ट्रॅक्ट केलेले URL डाउनलोडसाठी सुरक्षित आहेत का?
नाही. परिणाम यादी वापरण्यापूर्वी डोमेन, फाइल प्रकार, परवानग्या आणि एक लहान नमुना पुनरावलोकन करा.
GrabAll पृष्ठ स्कॅन करते आणि प्रतिमा, दस्तऐवज, मीडिया आणि इतर डाउनलोड होण्याजोग्या फाईल्स एका स्पष्ट यादीत आणते, जेणेकरून आपण नेमके काय जतन करायचे आहे ते निवडू शकता.