स्कैन की हुई PDF का अनुवाद कैसे करें — लेआउट और मुहर बिगाड़े बिना
ट्रांसलेशन टूल के लिए स्कैन सिर्फ़ एक फ़ोटो है। उससे अनुवादित दस्तावेज़ बनाने के लिए तीन स्टेप चाहिए: टेक्स्ट पहचानना, अनुवाद करना और पेज को दोबारा बनाना।
आप स्कैन किया हुआ दस्तावेज़ किसी ट्रांसलेटर में डालते हैं और वापस मिलता है: ख़ाली पेज, कोई एरर, या बिना किसी ढाँचे का टूटा-फूटा टेक्स्ट। ग़लती आपकी नहीं है। स्कैन की हुई PDF में ऐसा कोई टेक्स्ट होता ही नहीं जिसे ट्रांसलेटर पढ़ सके — हर पेज एक इमेज है, कागज़ की फ़ोटो। Google Translate, DeepL और ज़्यादातर PDF टूल यहीं अटक जाते हैं।
यह गाइड बताती है कि स्कैन पहचानें कैसे, कौन से तरीक़े सचमुच काम करते हैं, और आख़िर में ऐसा दस्तावेज़ कैसे मिले जो हूबहू मूल जैसा दिखे — बस भाषा हिंदी या अंग्रेज़ी हो।
क्या मेरी PDF सच में स्कैन है? 5 सेकंड का टेस्ट
PDF खोलें और माउस से कोई वाक्य सेलेक्ट करने की कोशिश करें। अगर टेक्स्ट सेलेक्ट और कॉपी हो रहा है तो यह डिजिटल PDF है और आम ट्रांसलेटर काम करेंगे। अगर कुछ सेलेक्ट नहीं होता (या पूरा पेज एक इमेज की तरह सेलेक्ट होता है) तो यह स्कैन है। फ़ोन से खींची फ़ोटो और WhatsApp पर आई कॉपियों के साथ भी यही बात है।
आम टूल यहाँ क्यों रुक जाते हैं
- Google Translate का डॉक्युमेंट मोड टेक्स्ट लेयर मानकर चलता है — स्कैन में पढ़ने को कुछ है ही नहीं, और 10 MB से ऊपर की फ़ाइल वह लेता ही नहीं।
- DeepL मुफ़्त प्लान में गिनी-चुनी फ़ाइलें और बिना OCR के करता है — स्कैन पढ़ा ही नहीं जाता।
- अकेला OCR सॉफ़्टवेयर (जैसे प्रिंटर के साथ आने वाला) टेक्स्ट तो निकालता है पर अनुवाद नहीं करता, और लेआउट अक्सर फेंक देता है।
- चैटबॉट अब स्कैन अच्छे से पढ़ लेते हैं, लेकिन दस्तावेज़ की जगह चैट का टेक्स्ट देते हैं: टेबल, मुहर और पेज का ढाँचा ग़ायब, और देवनागरी कई बार टूटे डिब्बों में।
स्कैन को सचमुच क्या चाहिए: पहचानो, हटाओ, दोबारा लिखो
स्कैन से अनुवादित दस्तावेज़ बनाने के तीन स्टेप हैं। पहला OCR: टेक्स्ट पहचान पेज की इमेज पर लिखा हुआ पढ़ती है, हर लाइन की जगह के साथ। दूसरा अनुवाद। तीसरा — और यही वह स्टेप है जो लगभग सारे टूल छोड़ देते हैं — मूल टेक्स्ट को पेज की इमेज से हटाना और अनुवाद ठीक उसी जगह दोबारा लिखना। तभी टेबल, कॉलम, मुहर और हस्ताक्षर की लाइनें वहीं रहती हैं जहाँ होनी चाहिए।
Reglyph ये तीनों स्टेप अपने आप करता है। आप स्कैन (या फ़ोन की फ़ोटो) अपलोड करते हैं, टूल टेक्स्ट पहचानता है, अनुवाद करता है और हर पेज को हूबहू दोबारा बनाता है। देवनागरी की मात्राएँ और संयुक्ताक्षर साफ़ छपे दस्तावेज़ों पर सही पढ़े जाते हैं — प्रमाण पत्रों में नाम और पते के लिए यह सबसे ज़रूरी है। जाँच के लिए मूल और अनुवाद आमने-सामने दिखाने वाला द्विभाषी व्यू है। हर दिन पहले 5 पेज मुफ़्त, क्रेडिट कार्ड नहीं चाहिए; पेड प्लान $3 से शुरू।
लेआउट बचाना: क्या-क्या अपनी जगह रहना चाहिए
- टेबल और कॉलम — हर सेल में उसका अपना कंटेंट, हेडर सही वैल्यू के ऊपर (बैंक स्टेटमेंट, बिल, मार्कशीट)।
- फ़ॉर्म के खाने और चेकबॉक्स — अनुवाद खाने के अंदर, बगल में नहीं (वीज़ा फ़ॉर्म, सरकारी आवेदन, इंश्योरेंस)।
- मुहर, हस्ताक्षर और बारकोड — छुए नहीं जाते, ताकि दस्तावेज़ मूल की कॉपी की तरह पहचाना जाए।
- अंक, तारीख़ें और रक़म — कभी अनुवादित नहीं होते, जस के तस रहते हैं।
- हिंदी-अंग्रेज़ी द्विभाषी फ़ॉर्म — सिर्फ़ हिंदी हिस्सा बदलता है, पहले से छपी अंग्रेज़ी वैसी ही रहती है।
जन्म और विवाह प्रमाण पत्र, 10वीं–12वीं की मार्कशीट और डिग्री (विदेश में दाख़िले और WES के लिए), बैंक स्टेटमेंट और सैलरी स्लिप (वीज़ा की प्रूफ़-ऑफ़-फ़ंड्स), एफ़िडेविट, राशन कार्ड और निवास प्रमाण पत्र, मेडिकल रिपोर्ट। लगभग सब स्कैन या फ़ोटो के रूप में ही मिलते हैं, और लगभग सब में मुहर, खाने और टेबल मायने रखती हैं।
और अगर सरकारी काम के लिए चाहिए?
दूतावास, कोर्ट, यूनिवर्सिटी और क्रेडेंशियल मूल्यांकन संस्थाएँ (जैसे WES) आम तौर पर प्रमाणित अनुवादक के हस्ताक्षर वाली प्रति माँगती हैं, कभी-कभी नोटरी भी — यह काम मशीन नहीं कर सकती। लेआउट बचाने वाला मशीन अनुवाद फिर भी बहुत काम का है: अनुवादक के लिए तैयार ड्राफ़्ट के तौर पर ताकि वह शून्य से शुरू न करे, काम सौंपने से पहले कंटेंट समझने के लिए, और उन सब मौक़ों पर जहाँ प्रमाणन की ज़रूरत ही नहीं।
अक्सर पूछे जाने वाले सवाल
क्या स्कैन की हुई PDF मुफ़्त में ट्रांसलेट हो सकती है?
हाँ, ऐसे टूल से जिसमें OCR बना हुआ हो। Reglyph हर दिन 5 पेज मुफ़्त अनुवाद करता है (क्रेडिट कार्ड नहीं चाहिए), स्कैन और फ़ोन की फ़ोटो समेत, और लेआउट बनाए रखता है। Google Translate और DeepL Free स्कैन प्रोसेस नहीं कर पाते।
क्या मुहर, हस्ताक्षर और टेबल बची रहेंगी?
हाँ। Reglyph पेज की इमेज से सिर्फ़ पहचाना गया टेक्स्ट हटाता है और अनुवाद उसी जगह लिखता है — मुहर, हस्ताक्षर, लोगो, टेबल की लाइनें, बारकोड और अंक बिना बदले अपनी जगह रहते हैं।
स्कैनर नहीं है, फ़ोन की फ़ोटो से चलेगा?
हाँ। अच्छी रोशनी में साफ़ और जितना हो सके सीधी खींची फ़ोटो काफ़ी है। छपे हुए दस्तावेज़ सबसे भरोसेमंद हैं; ज़्यादा हस्तलिखित कागज़ पहचानना मुश्किल हो सकता है।
क्या मशीन अनुवाद सरकारी काम के लिए काफ़ी है?
नहीं। सरकारी कामों में आम तौर पर प्रमाणित अनुवादक की प्रति माँगी जाती है। मशीन अनुवाद ड्राफ़्ट के तौर पर और पहले से कंटेंट जाँचने के लिए सही है।