
संवाद 24 डेस्क। कागजों में दर्ज जानकारी को डिजिटल रूप में बदलना सुनने में जितना आसान लगता है, वास्तविक दुनिया में यह काम उतना ही जटिल है। साफ-सुथरे टाइप किए हुए दस्तावेज को पढ़ना किसी कृत्रिम बुद्धिमत्ता प्रणाली के लिए अपेक्षाकृत आसान हो सकता है, लेकिन पुराने स्कैन, बहु-स्तरीय तालिकाएं, अलग-अलग खानों वाले प्रपत्र, छोटे अक्षर और हाथ से लिखी भारतीय भाषाओं वाली सामग्री अब भी बड़ी चुनौती हैं। इसी समस्या को ध्यान में रखते हुए भारतीय कृत्रिम बुद्धिमत्ता कंपनी सर्वम एआई ने सर्वम विजन 2.1 पेश किया है। कंपनी के अनुसार यह नया दृश्य-भाषा मॉडल दस्तावेजों को पढ़ने के साथ-साथ उनमें से संरचित जानकारी निकालने, जटिल तालिकाओं को समझने और भारतीय भाषाओं में लिखी हस्तलिखित सामग्री को पहचानने की क्षमता को बेहतर बनाता है।
सर्वम विजन 2.1 आखिर है क्या?
सर्वम विजन 2.1 एक दृश्य-भाषा मॉडल है, यानी ऐसा एआई मॉडल जो केवल लिखित शब्दों को नहीं, बल्कि तस्वीर, दस्तावेज की संरचना, तालिका, खानों और दृश्य संबंधों को भी समझने की कोशिश करता है। इसका उपयोग विशेष रूप से दस्तावेज-बुद्धिमत्ता से जुड़े कामों के लिए किया जा सकता है।
सर्वम ने इससे पहले फरवरी 2026 में अपना मूल सर्वम विजन मॉडल पेश किया था। उस मॉडल का प्रमुख ध्यान भारतीय भाषाओं में ओसीआर, तालिका विश्लेषण, दृश्य समझ और दस्तावेज से जानकारी निकालने पर था। कंपनी के अनुसार नए संस्करण में वास्तविक उपयोग के दौरान सामने आई कुछ कमियों को ध्यान में रखते हुए दस्तावेजों की संरचना समझने, प्रपत्रों से जानकारी निकालने और भारतीय भाषाओं की हस्तलिपि पहचानने जैसी क्षमताओं को मजबूत किया गया है।
टेढ़े-मेढ़े और पुराने दस्तावेजों की चुनौती क्यों बड़ी है?
किसी दस्तावेज की तस्वीर सीधी, साफ और उच्च गुणवत्ता वाली हो तो सामान्य ओसीआर प्रणाली भी शब्द पहचान सकती है। समस्या तब पैदा होती है जब पन्ना तिरछा हो, स्कैन पुराना हो, अक्षर बहुत छोटे हों, एक ही पन्ने पर कई स्तंभ हों या तालिका कई पृष्ठों में फैली हो।
ऐसे दस्तावेज में केवल अक्षरों की पहचान पर्याप्त नहीं होती। एआई को यह भी समझना पड़ता है कि कौन-सा शब्द किस खाने से जुड़ा है, तालिका की कौन-सी पंक्ति किस शीर्षक के अंतर्गत आती है और अलग-अलग पृष्ठों पर जारी तालिका वास्तव में एक ही संरचना का हिस्सा है। सर्वम विजन 2.1 को इन्हीं जटिल परिस्थितियों के लिए अधिक उपयोगी बनाने का दावा किया गया है। कंपनी ने अपने परीक्षणों में पुराने स्कैन, बहु-स्तंभ वाले पृष्ठ, तालिकाओं और छोटे अक्षरों वाले दस्तावेजों को भी शामिल किया है।
केवल पढ़ेगा नहीं, दस्तावेज का ढांचा भी समझेगा
सर्वम विजन 2.1 की सबसे महत्वपूर्ण विशेषताओं में से एक संरचित जानकारी निकालने की क्षमता है। उदाहरण के लिए किसी आवेदन-पत्र में नाम, पता, जन्मतिथि, पहचान संख्या या अन्य विवरण अलग-अलग खानों में दिए गए हैं। सामान्य ओसीआर इन सभी शब्दों को पढ़कर एक लंबा पाठ बना सकता है, लेकिन उपयोगी डिजिटल प्रणाली के लिए यह जानना जरूरी है कि कौन-सी जानकारी किस खाने से संबंधित है।
सर्वम के अनुसार विजन 2.1 प्रपत्रों से कुंजी-मूल्य जानकारी निकालने पर बेहतर काम करता है। इसका अर्थ है कि दस्तावेज में किसी निश्चित क्षेत्र के सामने लिखी जानकारी को पहचानकर उसे व्यवस्थित रूप में प्रस्तुत किया जा सके। यही क्षमता बैंकिंग, बीमा, सरकारी कार्यालयों, वित्तीय संस्थानों और बड़े दस्तावेजी अभिलेखों के डिजिटलीकरण में महत्वपूर्ण हो सकती है।
कई पन्नों में फैली तालिका भी बनेगी डिजिटल
व्यावसायिक और सरकारी दस्तावेजों में अक्सर ऐसी तालिकाएं होती हैं जो एक पृष्ठ में पूरी नहीं होतीं। किसी वित्तीय रिपोर्ट, सूची, अभिलेख या शोध दस्तावेज में तालिका कई पृष्ठों तक चल सकती है। ऐसे मामलों में प्रत्येक पृष्ठ को अलग-अलग पढ़ना पर्याप्त नहीं है, क्योंकि मूल तालिका की संरचना बनाए रखना जरूरी होता है।
सर्वम ने विजन 2.1 में बहु-पृष्ठ तालिकाओं को समझने और उनसे संरचित जानकारी निकालने पर विशेष ध्यान दिया है। कंपनी के अनुसार यह मॉडल जटिल तालिका संरचनाओं और घने बहु-क्षेत्रीय दस्तावेजों पर पहले की तुलना में बेहतर काम करता है।
अब भारतीय भाषाओं की हस्तलिपि पर भी जोर
भारत जैसे बहुभाषी देश में दस्तावेजों का एक बड़ा हिस्सा केवल अंग्रेजी में नहीं है। सरकारी अभिलेख, आवेदन-पत्र, पुराने दस्तावेज और स्थानीय स्तर के रिकॉर्ड विभिन्न भारतीय भाषाओं में उपलब्ध हैं। इनमें बड़ी मात्रा में हस्तलिखित सामग्री भी हो सकती है।
सर्वम विजन 2.1 में भारतीय भाषाओं की हस्तलिखित सामग्री को पहचानने की क्षमता को प्रमुख सुधार के रूप में पेश किया गया है। कंपनी का कहना है कि मॉडल अंग्रेजी के साथ 22 भारतीय भाषाओं में काम करता है और हस्तलिखित भारतीय-भाषा सामग्री को पहचानने तथा उससे संरचित जानकारी निकालने के लिए प्रशिक्षित किया गया है।
यह सुविधा खास तौर पर उन क्षेत्रों के लिए महत्वपूर्ण हो सकती है जहां पुराने कागजी रिकॉर्ड को डिजिटल संग्रह में बदलने का काम चल रहा है। हालांकि वास्तविक उपयोग में अलग-अलग भाषाओं, लिखावट और दस्तावेज की गुणवत्ता के अनुसार परिणाम बदल सकते हैं।
6,909 नमूनों वाला भारतीय ओसीआर परीक्षण
सर्वम ने विजन 2.1 के साथ अपना सर्वम इंडिक ओसीआर बेंच भी जारी किया है। कंपनी के अनुसार इसमें कुल 6,909 नमूने हैं, जिनमें 22 भारतीय भाषाओं के 6,609 नमूने और अंग्रेजी के 300 नमूने शामिल हैं। इन नमूनों को समाचार पत्रों, पुस्तकों, पुस्तिकाओं, ऐतिहासिक लेखन और अन्य स्रोतों से लिया गया है तथा सामग्री की समय-सीमा 1800 से वर्तमान काल तक बताई गई है।
कंपनी द्वारा प्रकाशित परिणामों में सर्वम विजन 2.1 का समग्र भारतीय ओसीआर अंक 87.39 बताया गया है। कंपनी ने इसे अपने परीक्षण में शामिल अन्य प्रणालियों के मुकाबले उच्चतम परिणाम के रूप में प्रस्तुत किया है। यहां यह समझना जरूरी है कि यह एक विशिष्ट बेंचमार्क का परिणाम है और इसे हर प्रकार के वास्तविक दस्तावेज पर 87.39 प्रतिशत सटीकता की गारंटी नहीं माना जा सकता।
वैश्विक दस्तावेज परीक्षण में भी किया प्रदर्शन
सर्वम के अनुसार विजन 2.1 ने olmOCR-Bench में 87.3 का समग्र अंक हासिल किया। इस परीक्षण में गणितीय सामग्री, पुराने स्कैन, बहु-स्तंभ वाले पृष्ठ, छोटे अक्षर और तालिकाओं सहित विभिन्न प्रकार के दस्तावेज शामिल होते हैं।
कंपनी की प्रकाशित तालिका के अनुसार विजन 2.1 का आधारभूत दस्तावेज श्रेणी में अंक 99.8, तालिका श्रेणी में 91.9 और पुराने स्कैन की श्रेणी में 55.3 रहा। इसका कुल अंक 87.3 बताया गया है।
इन आंकड़ों को समझते समय यह अंतर महत्वपूर्ण है कि किसी मॉडल का कुल बेंचमार्क अंक उसके हर प्रकार के दस्तावेज पर समान प्रदर्शन का प्रमाण नहीं होता। स्वयं पुराने स्कैन की श्रेणी का अंक कुल अंक से काफी कम है। इसलिए ‘हर टेढ़े-मेढ़े स्कैन को बिल्कुल सही पढ़ लेगा’ जैसी निश्चित धारणा बनाना उचित नहीं होगा।
ओसीआर से आगे बढ़कर व्यावसायिक उपयोग पर जोर
सर्वम विजन 2.1 को केवल शोध प्रयोग के लिए नहीं, बल्कि उत्पादन स्तर के उपयोग के लिए तैयार करने पर भी जोर दे रहा है। कंपनी के अनुसार मॉडल की अनुमान-प्रक्रिया वाली व्यवस्था में सुधार किए गए हैं, जिससे सेवा की लागत को पहले घोषित स्तर से कम किया जा सका और एपीआई को बड़े पैमाने पर उपयोग के लिए अधिक अनुकूल बनाया गया है।
इसका संभावित प्रभाव उन संस्थानों पर पड़ सकता है जहां रोजाना हजारों दस्तावेजों को डिजिटल डेटा में बदलने की आवश्यकता होती है। बैंक, बीमा कंपनियां, वित्तीय संस्थान, सरकारी विभाग, अनुसंधान संस्थान और बड़े उद्यम ऐसे क्षेत्रों में आते हैं जहां दस्तावेजों का डिजिटलीकरण समय और श्रम दोनों की बड़ी बचत कर सकता है।
क्या सचमुच कुछ सेकंड में पूरा दस्तावेज तैयार हो जाएगा?
इस सवाल पर सावधानी जरूरी है। विजन 2.1 को लेकर आकर्षक भाषा में यह कहा जा सकता है कि एआई जटिल कागज से तेजी से जानकारी निकाल सकता है, लेकिन उपलब्ध आधिकारिक जानकारी किसी भी दस्तावेज के लिए निश्चित ‘कुछ सेकंड’ में पूर्ण और त्रुटिरहित परिणाम की सार्वभौमिक गारंटी नहीं देती।
प्रसंस्करण का समय दस्तावेज की लंबाई, तस्वीर की गुणवत्ता, पृष्ठों की संख्या, संरचना और उपयोग किए जाने वाले तरीके पर निर्भर कर सकता है। इसलिए इस तकनीक की वास्तविक उपलब्धि को ‘हर कागज कुछ सेकंड में पूरी तरह डिजिटल’ के बजाय ‘जटिल दस्तावेजों से संरचित डेटा निकालने की क्षमता में सुधार’ के रूप में समझना अधिक तथ्यात्मक होगा।
पुराने संस्करण की कमियों पर भी किया गया काम
सर्वम के अनुसार पहले संस्करण से जुड़े उपयोग के दौरान दो प्रमुख क्षेत्रों में सुधार की जरूरत सामने आई थी—जटिल दस्तावेजों को संभालना और व्यावहारिक उपयोग की लागत। इसके अलावा मॉडल में कभी-कभी ऐसी जानकारी उत्पन्न होने की समस्या भी थी जो मूल दस्तावेज में मौजूद नहीं होती, जिसे एआई की भाषा में भ्रम या ‘हैलुसिनेशन’ कहा जाता है।
विजन 2.1 में कंपनी ने इन असंगतियों को कम करने का दावा किया है। इसके लिए नए प्रशिक्षण आंकड़ों के साथ पर्यवेक्षित सूक्ष्म-प्रशिक्षण और सत्यापन योग्य पुरस्कार आधारित सुदृढ़ीकरण प्रशिक्षण जैसी तकनीकों का उपयोग किए जाने की जानकारी दी गई है।
भारत के लिए क्यों महत्वपूर्ण हो सकता है यह मॉडल?
भारत में बड़ी मात्रा में जानकारी अभी भी कागजी दस्तावेजों, पुराने अभिलेखों और स्थानीय भाषाओं में सुरक्षित है। इस सामग्री को डिजिटल रूप में बदलने की प्रक्रिया केवल स्कैन करने से पूरी नहीं होती। स्कैन की गई तस्वीर को खोज योग्य, व्यवस्थित और मशीन द्वारा उपयोग किए जा सकने वाले डेटा में बदलना अगला बड़ा चरण है।
यहीं दस्तावेज-बुद्धिमत्ता आधारित एआई मॉडल उपयोगी हो सकते हैं। यदि कोई प्रणाली अलग-अलग भारतीय भाषाओं, हस्तलिखित सामग्री, तालिकाओं और प्रपत्रों को बेहतर ढंग से समझ पाती है तो सरकारी रिकॉर्ड, वित्तीय दस्तावेज, बीमा दावे, आवेदन-पत्र और पुराने अभिलेखों के डिजिटलीकरण की प्रक्रिया अधिक स्वचालित हो सकती है।
लेकिन मानवीय जांच की जरूरत खत्म नहीं होगी
एआई आधारित दस्तावेज प्रसंस्करण में सुधार के बावजूद संवेदनशील दस्तावेजों के मामले में मानवीय सत्यापन महत्वपूर्ण रहेगा। बैंक खाते, पहचान संबंधी जानकारी, कानूनी रिकॉर्ड, स्वास्थ्य दस्तावेज या सरकारी प्रमाण-पत्रों में एक छोटी-सी गलत पहचान भी गंभीर परिणाम पैदा कर सकती है।
इसलिए विजन 2.1 जैसे मॉडल को दस्तावेज पढ़ने और प्रारंभिक डेटा निकालने के शक्तिशाली साधन के रूप में देखना अधिक व्यावहारिक होगा। अंतिम निर्णय या संवेदनशील जानकारी की पुष्टि के लिए संस्थानों को अपनी जांच प्रक्रिया बनाए रखनी होगी।
कागज से डेटा तक एआई की नई छलांग
सर्वम विजन 2.1 का लॉन्च भारत में दस्तावेज-केंद्रित कृत्रिम बुद्धिमत्ता के तेजी से विकसित होते क्षेत्र की ओर संकेत करता है। इसका लक्ष्य केवल शब्द पहचानना नहीं, बल्कि दस्तावेज की संरचना समझकर तालिकाओं, प्रपत्रों और हस्तलिखित सामग्री से उपयोगी तथा व्यवस्थित जानकारी निकालना है।
कंपनी के अपने परीक्षणों में 22 भारतीय भाषाओं वाले ओसीआर बेंचमार्क पर 87.39 और olmOCR-Bench पर 87.3 का परिणाम सामने आया है। हालांकि ये कंपनी द्वारा बताए गए विशिष्ट परीक्षणों के परिणाम हैं और वास्तविक दुनिया में सटीकता दस्तावेज के प्रकार और गुणवत्ता के अनुसार बदल सकती है।
भारत में डिजिटल अभिलेखों का विस्तार जिस गति से हो रहा है, उसमें ऐसी तकनीक की उपयोगिता केवल तकनीकी उपलब्धि तक सीमित नहीं रहेगी। यदि जटिल, पुराने और हस्तलिखित दस्तावेजों को विश्वसनीय ढंग से डिजिटल डेटा में बदलना संभव होता है, तो इससे सरकारी सेवाओं, वित्तीय संस्थानों, बीमा, शिक्षा और उद्योगों में दस्तावेज प्रसंस्करण का तरीका बदल सकता है। सर्वम विजन 2.1 इसी दिशा में एक महत्वपूर्ण तकनीकी प्रयास के रूप में सामने आया है—हालांकि इसकी वास्तविक उपयोगिता का अंतिम आकलन बड़े पैमाने पर स्वतंत्र और वास्तविक-विश्व उपयोग के बाद ही किया जा सकेगा।






