PDF से टेक्स्ट के बारे में
यह PDF से सादा टेक्स्ट निकालता है ताकि आप उसका दोबारा उपयोग कर सकें — किसी दस्तावेज़ या ईमेल में पेस्ट करें, किसी रिपोर्ट से उद्धरण लें, किसी अनुवादक या नोट्स ऐप में डालें, या फ़ॉर्मेटिंग हटाकर केवल शब्द पाएँ। यह टेक्स्ट को वैसे ही पढ़ता है जैसे वह फ़ाइल में संग्रहीत है, पेज-दर-पेज, और परिणाम कॉपी करने या .txt के रूप में डाउनलोड करने के लिए देता है।
एक्सट्रैक्शन आपके डिवाइस पर चलता है, इसलिए गोपनीय दस्तावेज़ भी निजी रहते हैं।
यह कैसे काम करता है
PDF आपके ब्राउज़र में pdf.js से खुलता है। हर पेज के लिए, टूल पेज की टेक्स्ट लेयर पढ़ता है — असली अक्षर और स्थिति डेटा जो PDF संग्रहीत करता है — और उसे जोड़ता है, पेजों को एक खाली लाइन से अलग करते हुए। यह टेक्स्ट को आगे बढ़ते हुए दिखाता है, इसलिए आप उसे पेज-दर-पेज भरते देखते हैं, और "पेज X में से N" स्थिति दिखाता है। कुछ भी दोबारा टाइप या अनुमानित नहीं होता; यह वही टेक्स्ट सामने लाता है जो वाकई फ़ाइल में है।
मान्यताएँ और डिफ़ॉल्ट
- यह एम्बेडेड टेक्स्ट लेयर पढ़ता है, इसलिए परिणाम इस पर निर्भर करते हैं कि PDF कैसे बना। Word, ब्राउज़र या अधिकांश सॉफ़्टवेयर से निर्यात किए गए PDF में साफ़ टेक्स्ट लेयर होती है; स्कैन किए गए या केवल-इमेज PDF में कोई नहीं होती।
- पेज दस्तावेज़ के क्रम में दिखाए जाते हैं, एक खाली लाइन से अलग।
- डाउनलोड स्रोत PDF के नाम वाला सादा-टेक्स्ट
.txtहोता है। - यदि कोई चयन-योग्य टेक्स्ट नहीं मिलता, तो टूल स्पष्ट रूप से बताता है कि PDF स्कैन किया हुआ लगता है और उसे OCR की ज़रूरत होगी।
सीमाएँ
- कोई OCR नहीं। यह मौजूदा टेक्स्ट पढ़ता है; स्कैन की गई इमेज या फोटो के भीतर के टेक्स्ट को नहीं पहचानता। यदि PDF एक स्कैन है, तो आपको खाली परिणाम और OCR की ज़रूरत का नोट मिलेगा — यह टूल वह चरण नहीं कर सकता।
- लेआउट पूरी तरह पुनर्निर्मित नहीं होता। टेक्स्ट उसी क्रम में निकलता है जिसमें PDF उसे संग्रहीत करता है, जो एक-कॉलम दस्तावेज़ों के लिए आमतौर पर सही है, पर जटिल लेआउट में कॉलम, टेबल, हेडर/फ़ुटर और टेक्स्ट बॉक्स को मिला या गलत क्रम में कर सकता है।
- फ़ॉर्मेटिंग हट जाती है — आपको सादा टेक्स्ट मिलता है, फ़ॉन्ट, बोल्ड/इटैलिक, शीर्षक या टेबल संरचना नहीं।
- एन्क्रिप्टेड या क्षतिग्रस्त PDF पढ़े नहीं जा सकते और त्रुटि दिखाएँगे।
गोपनीयता
टेक्स्ट पूरी तरह आपके ब्राउज़र में pdf.js से निकाला जाता है। आपका PDF और उसका टेक्स्ट कभी आपके डिवाइस से बाहर नहीं जाते — कुछ भी अपलोड या संग्रहीत नहीं होता।

