टेढ़े-मेढ़े हस्तलिखित कागज के स्कैन भी समझेगा एआई: सर्वम ने लॉन्च किया विजन 2.1, जटिल कागजात से डेटा निकालने में क्या है खास?

संवाद 24 डेस्क। कागजों में दर्ज जानकारी को डिजिटल रूप में बदलना सुनने में जितना आसान लगता है, वास्तविक दुनिया में यह काम उतना ही जटिल है। साफ-सुथरे टाइप किए हुए दस्तावेज को पढ़ना किसी कृत्रिम बुद्धिमत्ता प्रणाली के लिए अपेक्षाकृत आसान हो सकता है, लेकिन पुराने स्कैन, बहु-स्तरीय तालिकाएं, अलग-अलग खानों वाले प्रपत्र, छोटे अक्षर और हाथ से लिखी भारतीय भाषाओं वाली सामग्री अब भी बड़ी चुनौती हैं। इसी समस्या को ध्यान में रखते हुए भारतीय कृत्रिम बुद्धिमत्ता कंपनी सर्वम एआई ने सर्वम विजन 2.1 पेश किया है। कंपनी के अनुसार यह नया दृश्य-भाषा मॉडल दस्तावेजों को पढ़ने के साथ-साथ उनमें से संरचित जानकारी निकालने, जटिल तालिकाओं को समझने और भारतीय भाषाओं में लिखी हस्तलिखित सामग्री को पहचानने की क्षमता को बेहतर बनाता है।

सर्वम विजन 2.1 आखिर है क्या?
सर्वम विजन 2.1 एक दृश्य-भाषा मॉडल है, यानी ऐसा एआई मॉडल जो केवल लिखित शब्दों को नहीं, बल्कि तस्वीर, दस्तावेज की संरचना, तालिका, खानों और दृश्य संबंधों को भी समझने की कोशिश करता है। इसका उपयोग विशेष रूप से दस्तावेज-बुद्धिमत्ता से जुड़े कामों के लिए किया जा सकता है।
सर्वम ने इससे पहले फरवरी 2026 में अपना मूल सर्वम विजन मॉडल पेश किया था। उस मॉडल का प्रमुख ध्यान भारतीय भाषाओं में ओसीआर, तालिका विश्लेषण, दृश्य समझ और दस्तावेज से जानकारी निकालने पर था। कंपनी के अनुसार नए संस्करण में वास्तविक उपयोग के दौरान सामने आई कुछ कमियों को ध्यान में रखते हुए दस्तावेजों की संरचना समझने, प्रपत्रों से जानकारी निकालने और भारतीय भाषाओं की हस्तलिपि पहचानने जैसी क्षमताओं को मजबूत किया गया है।

टेढ़े-मेढ़े और पुराने दस्तावेजों की चुनौती क्यों बड़ी है?
किसी दस्तावेज की तस्वीर सीधी, साफ और उच्च गुणवत्ता वाली हो तो सामान्य ओसीआर प्रणाली भी शब्द पहचान सकती है। समस्या तब पैदा होती है जब पन्ना तिरछा हो, स्कैन पुराना हो, अक्षर बहुत छोटे हों, एक ही पन्ने पर कई स्तंभ हों या तालिका कई पृष्ठों में फैली हो।
ऐसे दस्तावेज में केवल अक्षरों की पहचान पर्याप्त नहीं होती। एआई को यह भी समझना पड़ता है कि कौन-सा शब्द किस खाने से जुड़ा है, तालिका की कौन-सी पंक्ति किस शीर्षक के अंतर्गत आती है और अलग-अलग पृष्ठों पर जारी तालिका वास्तव में एक ही संरचना का हिस्सा है। सर्वम विजन 2.1 को इन्हीं जटिल परिस्थितियों के लिए अधिक उपयोगी बनाने का दावा किया गया है। कंपनी ने अपने परीक्षणों में पुराने स्कैन, बहु-स्तंभ वाले पृष्ठ, तालिकाओं और छोटे अक्षरों वाले दस्तावेजों को भी शामिल किया है।

केवल पढ़ेगा नहीं, दस्तावेज का ढांचा भी समझेगा
सर्वम विजन 2.1 की सबसे महत्वपूर्ण विशेषताओं में से एक संरचित जानकारी निकालने की क्षमता है। उदाहरण के लिए किसी आवेदन-पत्र में नाम, पता, जन्मतिथि, पहचान संख्या या अन्य विवरण अलग-अलग खानों में दिए गए हैं। सामान्य ओसीआर इन सभी शब्दों को पढ़कर एक लंबा पाठ बना सकता है, लेकिन उपयोगी डिजिटल प्रणाली के लिए यह जानना जरूरी है कि कौन-सी जानकारी किस खाने से संबंधित है।
सर्वम के अनुसार विजन 2.1 प्रपत्रों से कुंजी-मूल्य जानकारी निकालने पर बेहतर काम करता है। इसका अर्थ है कि दस्तावेज में किसी निश्चित क्षेत्र के सामने लिखी जानकारी को पहचानकर उसे व्यवस्थित रूप में प्रस्तुत किया जा सके। यही क्षमता बैंकिंग, बीमा, सरकारी कार्यालयों, वित्तीय संस्थानों और बड़े दस्तावेजी अभिलेखों के डिजिटलीकरण में महत्वपूर्ण हो सकती है।

कई पन्नों में फैली तालिका भी बनेगी डिजिटल
व्यावसायिक और सरकारी दस्तावेजों में अक्सर ऐसी तालिकाएं होती हैं जो एक पृष्ठ में पूरी नहीं होतीं। किसी वित्तीय रिपोर्ट, सूची, अभिलेख या शोध दस्तावेज में तालिका कई पृष्ठों तक चल सकती है। ऐसे मामलों में प्रत्येक पृष्ठ को अलग-अलग पढ़ना पर्याप्त नहीं है, क्योंकि मूल तालिका की संरचना बनाए रखना जरूरी होता है।
सर्वम ने विजन 2.1 में बहु-पृष्ठ तालिकाओं को समझने और उनसे संरचित जानकारी निकालने पर विशेष ध्यान दिया है। कंपनी के अनुसार यह मॉडल जटिल तालिका संरचनाओं और घने बहु-क्षेत्रीय दस्तावेजों पर पहले की तुलना में बेहतर काम करता है।

अब भारतीय भाषाओं की हस्तलिपि पर भी जोर
भारत जैसे बहुभाषी देश में दस्तावेजों का एक बड़ा हिस्सा केवल अंग्रेजी में नहीं है। सरकारी अभिलेख, आवेदन-पत्र, पुराने दस्तावेज और स्थानीय स्तर के रिकॉर्ड विभिन्न भारतीय भाषाओं में उपलब्ध हैं। इनमें बड़ी मात्रा में हस्तलिखित सामग्री भी हो सकती है।
सर्वम विजन 2.1 में भारतीय भाषाओं की हस्तलिखित सामग्री को पहचानने की क्षमता को प्रमुख सुधार के रूप में पेश किया गया है। कंपनी का कहना है कि मॉडल अंग्रेजी के साथ 22 भारतीय भाषाओं में काम करता है और हस्तलिखित भारतीय-भाषा सामग्री को पहचानने तथा उससे संरचित जानकारी निकालने के लिए प्रशिक्षित किया गया है।
यह सुविधा खास तौर पर उन क्षेत्रों के लिए महत्वपूर्ण हो सकती है जहां पुराने कागजी रिकॉर्ड को डिजिटल संग्रह में बदलने का काम चल रहा है। हालांकि वास्तविक उपयोग में अलग-अलग भाषाओं, लिखावट और दस्तावेज की गुणवत्ता के अनुसार परिणाम बदल सकते हैं।

6,909 नमूनों वाला भारतीय ओसीआर परीक्षण
सर्वम ने विजन 2.1 के साथ अपना सर्वम इंडिक ओसीआर बेंच भी जारी किया है। कंपनी के अनुसार इसमें कुल 6,909 नमूने हैं, जिनमें 22 भारतीय भाषाओं के 6,609 नमूने और अंग्रेजी के 300 नमूने शामिल हैं। इन नमूनों को समाचार पत्रों, पुस्तकों, पुस्तिकाओं, ऐतिहासिक लेखन और अन्य स्रोतों से लिया गया है तथा सामग्री की समय-सीमा 1800 से वर्तमान काल तक बताई गई है।
कंपनी द्वारा प्रकाशित परिणामों में सर्वम विजन 2.1 का समग्र भारतीय ओसीआर अंक 87.39 बताया गया है। कंपनी ने इसे अपने परीक्षण में शामिल अन्य प्रणालियों के मुकाबले उच्चतम परिणाम के रूप में प्रस्तुत किया है। यहां यह समझना जरूरी है कि यह एक विशिष्ट बेंचमार्क का परिणाम है और इसे हर प्रकार के वास्तविक दस्तावेज पर 87.39 प्रतिशत सटीकता की गारंटी नहीं माना जा सकता।

वैश्विक दस्तावेज परीक्षण में भी किया प्रदर्शन
सर्वम के अनुसार विजन 2.1 ने olmOCR-Bench में 87.3 का समग्र अंक हासिल किया। इस परीक्षण में गणितीय सामग्री, पुराने स्कैन, बहु-स्तंभ वाले पृष्ठ, छोटे अक्षर और तालिकाओं सहित विभिन्न प्रकार के दस्तावेज शामिल होते हैं।
कंपनी की प्रकाशित तालिका के अनुसार विजन 2.1 का आधारभूत दस्तावेज श्रेणी में अंक 99.8, तालिका श्रेणी में 91.9 और पुराने स्कैन की श्रेणी में 55.3 रहा। इसका कुल अंक 87.3 बताया गया है।
इन आंकड़ों को समझते समय यह अंतर महत्वपूर्ण है कि किसी मॉडल का कुल बेंचमार्क अंक उसके हर प्रकार के दस्तावेज पर समान प्रदर्शन का प्रमाण नहीं होता। स्वयं पुराने स्कैन की श्रेणी का अंक कुल अंक से काफी कम है। इसलिए ‘हर टेढ़े-मेढ़े स्कैन को बिल्कुल सही पढ़ लेगा’ जैसी निश्चित धारणा बनाना उचित नहीं होगा।

ओसीआर से आगे बढ़कर व्यावसायिक उपयोग पर जोर
सर्वम विजन 2.1 को केवल शोध प्रयोग के लिए नहीं, बल्कि उत्पादन स्तर के उपयोग के लिए तैयार करने पर भी जोर दे रहा है। कंपनी के अनुसार मॉडल की अनुमान-प्रक्रिया वाली व्यवस्था में सुधार किए गए हैं, जिससे सेवा की लागत को पहले घोषित स्तर से कम किया जा सका और एपीआई को बड़े पैमाने पर उपयोग के लिए अधिक अनुकूल बनाया गया है।
इसका संभावित प्रभाव उन संस्थानों पर पड़ सकता है जहां रोजाना हजारों दस्तावेजों को डिजिटल डेटा में बदलने की आवश्यकता होती है। बैंक, बीमा कंपनियां, वित्तीय संस्थान, सरकारी विभाग, अनुसंधान संस्थान और बड़े उद्यम ऐसे क्षेत्रों में आते हैं जहां दस्तावेजों का डिजिटलीकरण समय और श्रम दोनों की बड़ी बचत कर सकता है।

क्या सचमुच कुछ सेकंड में पूरा दस्तावेज तैयार हो जाएगा?
इस सवाल पर सावधानी जरूरी है। विजन 2.1 को लेकर आकर्षक भाषा में यह कहा जा सकता है कि एआई जटिल कागज से तेजी से जानकारी निकाल सकता है, लेकिन उपलब्ध आधिकारिक जानकारी किसी भी दस्तावेज के लिए निश्चित ‘कुछ सेकंड’ में पूर्ण और त्रुटिरहित परिणाम की सार्वभौमिक गारंटी नहीं देती।
प्रसंस्करण का समय दस्तावेज की लंबाई, तस्वीर की गुणवत्ता, पृष्ठों की संख्या, संरचना और उपयोग किए जाने वाले तरीके पर निर्भर कर सकता है। इसलिए इस तकनीक की वास्तविक उपलब्धि को ‘हर कागज कुछ सेकंड में पूरी तरह डिजिटल’ के बजाय ‘जटिल दस्तावेजों से संरचित डेटा निकालने की क्षमता में सुधार’ के रूप में समझना अधिक तथ्यात्मक होगा।

पुराने संस्करण की कमियों पर भी किया गया काम
सर्वम के अनुसार पहले संस्करण से जुड़े उपयोग के दौरान दो प्रमुख क्षेत्रों में सुधार की जरूरत सामने आई थी—जटिल दस्तावेजों को संभालना और व्यावहारिक उपयोग की लागत। इसके अलावा मॉडल में कभी-कभी ऐसी जानकारी उत्पन्न होने की समस्या भी थी जो मूल दस्तावेज में मौजूद नहीं होती, जिसे एआई की भाषा में भ्रम या ‘हैलुसिनेशन’ कहा जाता है।
विजन 2.1 में कंपनी ने इन असंगतियों को कम करने का दावा किया है। इसके लिए नए प्रशिक्षण आंकड़ों के साथ पर्यवेक्षित सूक्ष्म-प्रशिक्षण और सत्यापन योग्य पुरस्कार आधारित सुदृढ़ीकरण प्रशिक्षण जैसी तकनीकों का उपयोग किए जाने की जानकारी दी गई है।

भारत के लिए क्यों महत्वपूर्ण हो सकता है यह मॉडल?
भारत में बड़ी मात्रा में जानकारी अभी भी कागजी दस्तावेजों, पुराने अभिलेखों और स्थानीय भाषाओं में सुरक्षित है। इस सामग्री को डिजिटल रूप में बदलने की प्रक्रिया केवल स्कैन करने से पूरी नहीं होती। स्कैन की गई तस्वीर को खोज योग्य, व्यवस्थित और मशीन द्वारा उपयोग किए जा सकने वाले डेटा में बदलना अगला बड़ा चरण है।
यहीं दस्तावेज-बुद्धिमत्ता आधारित एआई मॉडल उपयोगी हो सकते हैं। यदि कोई प्रणाली अलग-अलग भारतीय भाषाओं, हस्तलिखित सामग्री, तालिकाओं और प्रपत्रों को बेहतर ढंग से समझ पाती है तो सरकारी रिकॉर्ड, वित्तीय दस्तावेज, बीमा दावे, आवेदन-पत्र और पुराने अभिलेखों के डिजिटलीकरण की प्रक्रिया अधिक स्वचालित हो सकती है।

लेकिन मानवीय जांच की जरूरत खत्म नहीं होगी
एआई आधारित दस्तावेज प्रसंस्करण में सुधार के बावजूद संवेदनशील दस्तावेजों के मामले में मानवीय सत्यापन महत्वपूर्ण रहेगा। बैंक खाते, पहचान संबंधी जानकारी, कानूनी रिकॉर्ड, स्वास्थ्य दस्तावेज या सरकारी प्रमाण-पत्रों में एक छोटी-सी गलत पहचान भी गंभीर परिणाम पैदा कर सकती है।
इसलिए विजन 2.1 जैसे मॉडल को दस्तावेज पढ़ने और प्रारंभिक डेटा निकालने के शक्तिशाली साधन के रूप में देखना अधिक व्यावहारिक होगा। अंतिम निर्णय या संवेदनशील जानकारी की पुष्टि के लिए संस्थानों को अपनी जांच प्रक्रिया बनाए रखनी होगी।

कागज से डेटा तक एआई की नई छलांग
सर्वम विजन 2.1 का लॉन्च भारत में दस्तावेज-केंद्रित कृत्रिम बुद्धिमत्ता के तेजी से विकसित होते क्षेत्र की ओर संकेत करता है। इसका लक्ष्य केवल शब्द पहचानना नहीं, बल्कि दस्तावेज की संरचना समझकर तालिकाओं, प्रपत्रों और हस्तलिखित सामग्री से उपयोगी तथा व्यवस्थित जानकारी निकालना है।
कंपनी के अपने परीक्षणों में 22 भारतीय भाषाओं वाले ओसीआर बेंचमार्क पर 87.39 और olmOCR-Bench पर 87.3 का परिणाम सामने आया है। हालांकि ये कंपनी द्वारा बताए गए विशिष्ट परीक्षणों के परिणाम हैं और वास्तविक दुनिया में सटीकता दस्तावेज के प्रकार और गुणवत्ता के अनुसार बदल सकती है।
भारत में डिजिटल अभिलेखों का विस्तार जिस गति से हो रहा है, उसमें ऐसी तकनीक की उपयोगिता केवल तकनीकी उपलब्धि तक सीमित नहीं रहेगी। यदि जटिल, पुराने और हस्तलिखित दस्तावेजों को विश्वसनीय ढंग से डिजिटल डेटा में बदलना संभव होता है, तो इससे सरकारी सेवाओं, वित्तीय संस्थानों, बीमा, शिक्षा और उद्योगों में दस्तावेज प्रसंस्करण का तरीका बदल सकता है। सर्वम विजन 2.1 इसी दिशा में एक महत्वपूर्ण तकनीकी प्रयास के रूप में सामने आया है—हालांकि इसकी वास्तविक उपयोगिता का अंतिम आकलन बड़े पैमाने पर स्वतंत्र और वास्तविक-विश्व उपयोग के बाद ही किया जा सकेगा।

Geeta Singh
Geeta Singh

Leave a Reply

Your email address will not be published. Required fields are marked *