AI Hindi Test Update में LLaMA 3-70B हिंदी परीक्षा में केवल 39.53% ही ला पाया

Table of Contents

सीधा जवाब

नए AI Hindi Test Update के IndicEval टेस्ट में LLaMA 3-70B हिंदी में केवल 39.53% स्कोर कर पाया, जो सबसे कम था।

पर Google के इस Flash AI ने Chain-of-Thought (CoT) से कमाल किया। इसने NEET Chemistry के हिंदी test में सीधे 84.00% score बना दिया।

बिना CoT के इस Flash AI का स्कोर सिर्फ 44.00% था। देखिए, मतलब साफ़ है कि step-by-step prompt देते ही performance सुधर जाता है।

हाँ, नए IndicEval टेस्ट में LLaMA 3-70B मॉडल हिंदी भाषा में केवल 39.53% स्कोर के साथ फेल हो गया है। इस ब्लॉग में हम नए AI Hindi Test Update के रिजल्ट्स का पूरा विश्लेषण करेंगे। यहाँ हम देखेंगे कि Google और Sarvam AI जैसे बड़े ब्रैंड्स भारतीय भाषाओं में क्या बदलाव कर रहे हैं।

मुख्य बातें

  • नए IndicEval टेस्ट के हिसाब से LLaMA 3-70B मॉडल हिंदी भाषा की परीक्षा में केवल 39.53% मार्क्स ही हासिल कर पाया।
  • इसके विपरीत Gemini 2.0 Flash ने NEET Chemistry के हिंदी टेस्ट में Chain-of-Thought की मदद से 84% स्कोर किया।
  • IISc Bengaluru के SPIRE Lab ने SraVaani speech AI model को 65 भारतीय भाषाओं के लिए open-source जारी किया है।
  • ParamBench benchmark में Qwen3-30B-A3B ने केवल 3B active parameters के साथ 48.5% की शानदार accuracy प्राप्त की।
  • Mahindra University के HATS टेस्ट सेट में 405 तार्किक सवालों पर बड़े AI मॉडल्स का परीक्षण किया गया।

IndicEval Framework: हिंदी में क्यों पिछड़ रहे हैं बड़े AI/LLM मॉडल्स?

IndicEval framework के टेस्ट में LLaMA 3-70B ने अंग्रेजी भाषा में 67.00% स्कोर किया था। लेकिन यही मॉडल हिंदी Zero-Shot टेस्ट में गिरकर केवल 39.53% स्कोर ही ला पाया। यह इस टेस्ट का सबसे कम स्कोर है। यह भाषाई गिरावट उन भारतीय छात्रों के लिए बहुत बड़ी चुनौती है जो हिंदी माध्यम से पढ़ाई करते हैं।

आईपीएल का सबसे महंगा खिलाड़ी गली क्रिकेट की पिच पर आते ही शून्य पर आउट हो गया। घरेलू मैदान की मिट्टी को समझना सबके बस की बात नहीं है। आप ChatGPT या Gemini app में एक ही सवाल अंग्रेजी और हिंदी में पूछकर इसका अंतर खुद देख सकते हैं।

ये मॉडल्स हिंदी के व्याकरण और स्थानीय संदर्भ को सही ढंग से नहीं पकड़ पाते। वे अक्सर सीधे अंग्रेजी से अनुवाद करने की कोशिश करते हैं और बीच में ही उलझ जाते हैं। हालांकि इस विफलता का एक बहुत ही आसान और तकनीकी समाधान भी सामने आया है। इसके ज़रिए मॉडल्स के सोचने के तरीके को सुधारा जा सकता है।

Chain-of-Thought (CoT) का कमाल: क्या इससे सुधरेगा AI का स्कोर?

Gemini 2.0 Flash ने Chain-of-Thought तरीके का इस्तेमाल करके हिंदी रीजनिंग परीक्षाओं में अपना स्कोर लगभग दोगुना कर लिया है। गणित के मुश्किल सवाल को सीधे हल करना अक्सर नामुमकिन होता है। पर रफ कॉपी पर एक-एक स्टेप लिखने से जवाब तुरंत मिल जाता है।

नए AI Hindi Test Update के आंकड़े बताते हैं कि CoT prompting से मॉडल्स के सटीक तर्क में औसतन 11.59% का सुधार हुआ है। इसका standard deviation 9.47% दर्ज किया गया। बिना इस तरीके के Gemini 2.0 Flash ने NEET Chemistry के हिंदी टेस्ट में केवल 44.00% स्कोर किया था। लेकिन step-by-step सोचने के prompt के साथ यह स्कोर सीधे 84.00% पहुँच गया।

आप अभी अपने फोन पर Gemini app खोलें। किसी भी कठिन हिंदी सवाल के आगे 'step-by-step समझाओ' लिखकर prompt दें। हालांकि सीधे गणितीय तर्क में सफल होने के बावजूद ये मॉडल्स हिंदी के तार्किक शब्दों और सादृश्यों को समझने में अक्सर गच्चा खा जाते हैं।

HATS Test Set: हिंदी सादृश्यता (Analogy) में AI की बड़ी विफलताएं

इसमें सरकारी परीक्षाओं से लिए गए 405 बहुविकल्पीय सादृश्य प्रश्न शामिल हैं। इस टेस्ट का मुख्य मकसद यह जांचना था कि क्या AI शब्दों के छिपे हुए तार्किक संबंधों को समझ सकता है।

परीक्षण के दौरान Gemma-2-9B ने English-only settings में CoT के साथ सबसे अधिक 79.75% का बेहतरीन स्कोर किया। चाय की टपरी पर विदेशी चाय का ऑर्डर देना और बात है। पर वहां की देसी पंचायत में शामिल होना अलग बात है। हिंदी में काम करते समय ये models बुरी तरह लड़खड़ा गए।

अनुवाद करते समय ये models अक्सर खास शब्दों का बिल्कुल गलत मतलब निकाल लेते हैं। देखिए, बस एक जैसी आवाज से पूरा लॉजिक फेल हो जाता है। आप इस नए टेस्ट सेट को अभी GitHub पर देख सकते हैं। अब सोचिए, क्या इसका हल केवल बड़े models तैयार करना ही है?

Chain-of-Thought (CoT) Prompting

[अपना कठिन हिंदी सवाल यहाँ लिखें] 

ऊपर दिए गए सवाल को सीधे हल करने के बजाय, कृपया मुझे step-by-step समझाएं कि आप इस उत्तर तक कैसे पहुंचे।
A bar chart comparing model accuracy scores from the AI Hindi Test Update dataset
A bar chart comparing model accuracy scores from the AI Hindi Test Update dataset

ParamBench Benchmark: क्या भारतीय संस्कृति और कला को समझता है AI?

IIM Indore और BharatGen ने मिलकर ParamBench नाम का एक नया graduate-level टेस्ट सेट तैयार किया है। इसमें भारतीय इतिहास और योग जैसे 21 विषयों के 17,275 सवाल शामिल हैं। यहाँ सबसे बड़े AI मॉडल्स भी भारतीय कला को समझने में पिछड़ गए। हाल ही में आए AI Hindi Test Update के नतीजे यही हकीकत बयां करते हैं।

शादी की शहनाई और डीजे के शोर में बड़ा अंतर होता है। विदेशी मेहमान अक्सर हमारी शास्त्रीय राग-रागिनियों की बारीक तान नहीं समझ पाते। Google के Gemma3-27B मॉडल ने इस टेस्ट में सबसे ज़्यादा 56.4% स्कोर किया। वहीं छोटे मॉडल्स में Gemma3-4B केवल 40.2% स्कोर ही ला सका। संगीत जैसे विषयों में इनका प्रदर्शन 36% से भी नीचे चला गया।

Hugging Face पर जाकर ParamBench dataset के सवाल अभी खुद देखिए। भारतीय संस्कृति पर AI के फेल होने का यह सिलसिला यहीं खत्म नहीं होता। देखिए, इसकी सबसे बड़ी वजह हमारी अपनी क्षेत्रीय बोलियों में data की भारी कमी होना भी है।

SraVaani Speech AI: भारतीय भाषाओं के लिए खुली आवाज

यह एक open-source speech model है। यह मॉडल दूर-दराज के इलाकों की स्थानीय बोलियों को तुरंत टेक्स्ट में बदल सकता है। यह सुविधा हमारे देश के भाषाई अंतर को पाटने में अहम कदम है।

यह मॉडल कुल 65 भारतीय भाषाओं और बोलियों का समर्थन करता है। इसमें 20 अनुसूचित भाषाएं और 45 क्षेत्रीय बोलियां शामिल हैं। इनमें गारो, अंगिका और बुंदेली प्रमुख हैं। Project Vaani के तहत इसे ट्रेन किया गया है। इसमें 1.56 lakh लोगों की 31,000 घंटों की बातचीत का डेटा इस्तेमाल हुआ है।

हमारे देश में हर दस कोस पर बोली बदल जाती है। हमारी चाय की टपरी पर भी हर ग्राहक का अपना अलग अंदाज़ होता है। आप अभी Project Vaani की website पर जाकर अपने जिले की स्थानीय आवाज के नमूने सुन सकते हैं। लेकिन इस तकनीक को बड़े सरकारी स्तर पर भी लागू किया जा रहा है। इसका एक शानदार उदाहरण देखना दिलचस्प होगा।

AI ModelTest Set / FrameworkPerformance (English / with CoT)Performance (Hindi / without CoT)
LLaMA 3-70BIndicEval Framework67.00% Accuracy39.53% Accuracy (Zero-Shot)
Gemini 2.0 FlashNEET Chemistry (IndicEval)84.00% (with CoT Prompting)44.00% (without CoT)
Gemma3-27BParamBench BenchmarkN/A56.4% Overall Accuracy
Gemma-2-9BHATS Test Set79.75% (English-only setting with CoT)Translation failure (e.g. 'ईंट' understood as 'Eat')

BHASHINI: महाकुंभ 2025 में भाषा की दीवारें तोड़ने की सरकारी पहल

BHASHINI platform ने महाकुंभ 2025 में लाखों तीर्थयात्रियों की भाषा संबंधी बाधाओं को दूर करने का अहम काम किया है। यह अत्याधुनिक chatbot लोकप्रिय Llama LLM तकनीक पर आधारित है। यह कुल 11 भाषाओं में लोगों को सही और रीयल-टाइम जानकारी प्रदान करता है।

चाय की तपरी पर सुबह लगने वाली भीड़ में हर कोई अपनी बोली में ही बात करता है। वहां का चायवाला बिना संकोच के हर ऑर्डर समझ लेता है। यह मंच भी देश में ठीक इसी तरह काम करता है। नए AI Hindi Test Update के हिसाब से यह मंच हर महीने 10 करोड़ से अधिक translation inferences दर्ज कर रहा है।

इसे 7,00,000 से अधिक बार download किया जा चुका है। लेकिन इस सरकारी प्रयास के साथ ही भारतीय AI startups भी अब सीधे विदेशी कंपनियों को टक्कर देने लगे हैं।

Sarvam AI और स्वदेशी तकनीक: भारत की तकनीकी संप्रभुता का भविष्य

Sarvam AI जैसी स्वदेशी कंपनियां अब सिलिकॉन वैली के बड़े मॉडल्स को सीधी टक्कर दे रही हैं। भारत के ये नए AI स्टार्टअप देश को तकनीकी संप्रभुता दिलाने के बहुत करीब ले आए हैं। इन्होंने भारतीय भाषाओं की जरूरतों को ध्यान में रखकर अपना 105B parameter model तैयार किया है। यह मॉडल स्थानीय भाषाओं के व्याकरण को बहुत बारीकी से समझता है।

गली क्रिकेट में खुद का बल्ला होने का अलग ही रौब होता है। दूसरे के बल्ले से खेलने वाले खिलाड़ी को कभी भी पारी छोड़नी पड़ सकती है। इस स्वदेशी स्टार्टअप ने हाल ही में Unicorn का दर्जा हासिल किया है।

AI Hindi पर related videos

निष्कर्ष

देखिए, सीधी बात ये है कि हिंदी समझने में AI models अभी पहली क्लास में हैं। लेकिन भारतीय startups इस खेल को तेजी से बदल रहे हैं। जैसे Jio आने के बाद हर हाथ में internet आ गया, वैसे ही भाषा की दीवार बहुत जल्द खत्म होने वाली है। अब सोचिए, जब आपके phone का AI आपकी लोकल भाषा में सारे काम करेगा, तब आपको कितना बड़ा फायदा होगा। यानी आने वाला समय सिर्फ अंग्रेजी का नहीं, बल्कि हमारा है।

FAQs – अक्सर पूछे जाने वाले सवाल

1. IndicEval टेस्ट में LLaMA 3-70B का हिंदी में क्या स्कोर रहा?

Answer: IndicEval टेस्ट में LLaMA 3-70B का प्रदर्शन अंग्रेजी में 67.00% था, लेकिन हिंदी Zero-Shot टेस्ट में इसका स्कोर गिरकर केवल 39.53% रह गया, जो इस परीक्षा का सबसे कम स्कोर है।

2. Gemini 2.0 Flash ने हिंदी टेस्ट में अपना स्कोर कैसे सुधारा?

Answer: Gemini 2.0 Flash ने Chain-of-Thought (CoT) prompting तकनीक का इस्तेमाल करके NEET Chemistry हिंदी परीक्षा में अपना स्कोर 44.00% से बढ़ाकर सीधे 84.00% कर लिया।

3. भारतीय संस्कृति और संगीत को समझने में AI मॉडल्स का क्या प्रदर्शन रहा?

Answer: ParamBench benchmark के संगीत और कला से जुड़े विषयों में AI मॉडल्स का प्रदर्शन 36% से भी नीचे रहा, जहाँ Gemma3-27B ने सबसे अधिक 56.4% स्कोर हासिल किया।

4. SraVaani Speech AI मॉडल कितनी भारतीय भाषाओं का समर्थन करता है?

Answer: SraVaani Speech AI मॉडल कुल 65 भारतीय भाषाओं और बोलियों का समर्थन करता है, जिसमें 20 अनुसूचित भाषाएं और गारो, अंगिका व बुंदेली जैसी 45 क्षेत्रीय बोलियां शामिल हैं।

5. SraVaani Speech AI मॉडल को ट्रेन करने के लिए कितने डेटा का उपयोग किया गया है?

Answer: SraVaani Speech AI को Project Vaani के तहत ट्रेन किया गया है, जिसके लिए 1.56 lakh लोगों की 31,000 घंटों की बातचीत के ऑडियो डेटा का इस्तेमाल किया गया है।

6. हिंदी अनुवाद करते समय AI मॉडल्स से सबसे बड़ी तार्किक गलती क्या हुई?

Answer: HATS टेस्ट सेट में AI मॉडल्स ने ‘ईंट’ शब्द के ध्वनि साम्य के कारण उसे ‘Eat’ समझ लिया, जिससे ‘फूल : माला :: ईंट :?’ सादृश्यता का पूरा तार्किक संबंध फेल हो गया।

Leave a Comment