नेपाली साङ्केतिक भाषा पहिचान गर्न हामीले तयार गरेको डाटा, मोडेल नतिजा, असफलता र अब समुदायसँग गर्नुपर्ने कामको खुला अभिलेख।
हामी कहाँबाट सुरु गर्यौँ
यो काम सिधै “अनुवाद गर्ने एआई” बाट सुरु भएको होइन। हामीले पहिले एउटा स्पष्ट संकेत के जस्तो देखिन्छ भन्ने आधार बनायौँ, त्यसपछि मात्र प्राकृतिक निरन्तर साइनतर्फ गयौँ।
०१ / शब्दकोश
३,६५३ छुट्टाछुट्टै संकेतबाट पहिलो सन्दर्भ
शब्दकोश भिडियोमा एक पटकमा प्रायः एउटै अवधारणा सफा रूपमा देखाइन्छ। तिनलाई शब्द/अवधारणाअनुसार मिलाएर हामीले खोज ग्यालरी बनायौँ। यही ग्यालरीले “यो चाल कुन ज्ञात संकेतसँग सबैभन्दा मिल्छ?” भन्ने पहिलो प्रश्नको उत्तर दिन्छ।
सरल भाषामा: यो फोटोसहितको शब्दकोशजस्तै हो—वाक्य बुझ्दैन, तर स्पष्ट संकेत दाँज्न उपयोगी हुन्छ।
०२ / संसद
त्यसपछि प्राकृतिक, लगातार गरिएको साइन हेर्यौँ
संसद प्रसारणमा दोभाषेले वाक्यको अर्थसँगै लगातार साइन गर्नुहुन्छ। एउटा संकेत कहाँ सकियो र अर्को कहाँ सुरु भयो भन्ने सफा काट हुँदैन; हातको आकार, स्थान, अनुहार र गति छेउका संकेतसँग मिसिन्छ। बोलिएको क्याप्सन पनि साइनको शब्दशः समयरेखा होइन, त्यसैले त्यसलाई सत्य लेबल नभई सम्भावित सङ्केत मात्र मान्यौँ।
सरल भाषामा: शब्दकोशमा शब्द छुट्टाछुट्टै छन्; संसदमा ती बोल्दा जस्तै एक-अर्कामा बग्छन्।
०३ / Uni-Sign
अरू साङ्केतिक भाषाबाट सिकेको दृश्य प्रतिनिधित्व प्रयोग गर्यौँ
Uni-Sign अनुसन्धान ले ठूलो परिमाणको साइन भिडियोबाट शरीर, हात, अनुहार र दृश्यलाई उपयोगी प्रतिनिधित्वमा बदल्न सकिने देखायो। हामीले त्यसको पूर्व-प्रशिक्षित पोज भागलाई स्थिर आधारका रूपमा प्रयोग गर्यौँ—यसलाई नेपाली साङ्केतिक भाषा स्वतः जान्ने अनुवादक मानेनौँ।
सरल भाषामा: यसले चालको “डिजिटल औँठाछाप” बनाउँछ; त्यस औँठाछापको नेपाली अर्थ छुट्टै डाटा र मानव समीक्षाबाट सिकाउनुपर्छ।
०४ / RTMPose
भिडियोबाट शरीर र हातका बिन्दु निकाल्यौँ
RTMPose ले प्रत्येक फ्रेममा शरीर, हात र अनुहार कहाँ छन् भन्ने मुख्य बिन्दु पत्ता लगाउँछ। यसरी पृष्ठभूमि, कपडा वा भिडियो शैलीभन्दा चालको समयक्रममा ध्यान दिन सकिन्छ। तर यी बिन्दुले आफैँ “अर्थ” जान्दैनन् र औँला छोपिएको वा फ्रेम धमिलो भएको ठाउँमा गल्ती गर्न सक्छन्।
सरल भाषामा: यसले मानिसको चलिरहेको काँटामानचित्र बनाउँछ—नक्सा बनाउँछ, भाषा बुझ्दैन।
०५ / पहिलो पुल
शब्दकोशको संकेत संसदमा खोज्ने प्रयास गर्यौँ
पोजको छोटो झ्याललाई Uni-Sign प्रतिनिधित्वमा बदलेर ३,६५३ संकेतको ग्यालरीसँग दाँज्यौँ। सफा शिक्षण संकेतमा उपयोगी क्षमता देखियो, तर संसदका ७८७ सम्भावित खण्डमा नजिकको बोलीसँग शीर्ष–५ सहमति करिब २% मात्र रह्यो। त्यसैले स्वतः संसद लेबल गर्ने योजना रोकेर समस्याको कारण मापन गर्न थाल्यौँ।
शब्दकोश सन्दर्भ र निरन्तर क्लिप सँगसँगै देखाएर समीक्षकले संकेत उपस्थित छ/छैन भन्न, सही शब्द सच्याउन र IN/OUT ह्यान्डल तानेर सुरु-अन्त्य मिलाउन सक्ने उपकरण बनायौँ। यही प्रक्रियाबाट २१९ छुट्टै र ३७ निरन्तर मानव-पुष्टि मूल्याङ्कन उदाहरण बने।
सरल भाषामा: मेसिनले सम्भावित ठाउँ देखाउँछ; भाषा जान्ने मानिसले के भयो र कहिले भयो भन्ने अन्तिम निर्णय गर्छ।
०७ / निरन्तर तालिम
११९.६ घण्टा चालबाट निरन्तर प्रतिनिधित्व सुधार्ने प्रयास
संसदको ११९.६ घण्टा पोजलाई लेबलविहीन चाल सिकाइमा, र ४८९ शिक्षण खण्डलाई सीमित क्रम-सिकाइमा प्रयोग गर्यौँ। पाँच चरणका परीक्षणले सानो सुधार देखाए तर पूर्वनिर्धारित सफलता सीमा पार गरेनन्। अहिलेको बाधा कम्प्युट मात्र होइन—विश्वसनीय निरन्तर अर्थ र समय-मिलान हो।
सरल भाषामा: धेरै भिडियो हुनु पर्याप्त भएन; सही ठाउँमा सही अर्थ जोडिएको उदाहरण चाहियो।
मुख्य प्राविधिक सन्दर्भ: Uni-Sign · RTMPose। यी बाह्य विधि हुन्; नेपाली डाटा निर्माण, मूल्याङ्कन, ड्यासबोर्ड र निरन्तर-अनुकूलन यस परियोजनामा गरिएको हो।
प्रयोगमा विधि कसरी चल्छ
भिडियो सिधै शब्द बन्दैन। बीचमा चाल निकाल्ने, छोटो समय-झ्याल बनाउने, समानता खोज्ने, मानिसले मिलाउने र अलग परीक्षण गर्ने चरण छन्।
०१
स्रोत छुट्याउने
शब्दकोश, शिक्षण भिडियो र संसद प्रसारणलाई एउटै प्रकारको डाटा मानिँदैन। प्रत्येकको भूमिका र भरोसा छुट्टै लेखिन्छ।
०२
RTMPose पोज
फ्रेम-फ्रेमबाट शरीर, हात र अनुहारका बिन्दु निकालेर समयसँगै चलेको पोज बनाइन्छ।
०३
समय-झ्याल
निरन्तर चाललाई साना, एक-अर्कामाथि केही खप्टिने झ्यालमा काटिन्छ ताकि संकेतको सम्भावित सीमा नछुटोस्।
०४
Uni-Sign प्रतिनिधित्व
हरेक झ्याललाई तुलना गर्न मिल्ने सङ्ख्यात्मक प्रतिनिधित्वमा बदलिन्छ; नजिकका चालहरू नजिक पर्ने प्रयास हुन्छ।
०५
खोज र उम्मेदवार
प्रतिनिधित्वलाई ३,६५३ शब्दकोश सन्दर्भसँग दाँजेर सम्भावित अर्थ र समय निकालिन्छ। यो सुझाव हो, सत्य लेबल होइन।
०६
मानव IN/OUT मिलान
समीक्षकले भिडियो हेरेर अर्थ, भिन्न रूप र साइनको सही सुरु/अन्त्य सच्याउनुहुन्छ।
०७
तालिम
लेबल नभएको संसद पोजबाट चालको ढाँचा र मानव-मिलान शिक्षण खण्डबाट अवधारणाको क्रम सिकाइन्छ।
०८
स्थिर मूल्याङ्कन
२१९ छुट्टै र ३७ निरन्तर उदाहरण तालिमबाट अलग रहन्छन्; मोडेल सकिएपछि मात्र नतिजा जाँचिन्छ।
महत्त्वपूर्ण सीमा: संसदको बोली/क्याप्सन समय पत्ता लगाउने सङ्केत हुन सक्छ, तर नेपाली साङ्केतिक भाषाको शब्दशः सत्य मानिँदैन। मानव-पुष्टि नभएको क्याप्सन मूल्याङ्कन लेबल बन्दैन।
वास्तविक उपकरण र दृश्य
यी परियोजनाकै चलिरहेका ड्यासबोर्ड र पोज आउटपुट हुन्। सार्वजनिक चित्रका लागि आन्तरिक स्रोत पहिचान हटाइएको छ र व्यक्तिको अनुहार छोपिएको छ; हात, शरीर, समयरेखा र नतिजा जस्ताको तस्तै राखिएका छन्।
शब्दकोश → संसद मिलान। बायाँ स्पष्ट सन्दर्भ, बीचमा प्रसारणको प्राकृतिक संकेत, तल फ्रेम र IN/OUT नियन्त्रण। यही दृश्यले एउटै अवधारणा छुट्टै र वाक्यभित्र कति फरक देखिन्छ भन्ने देखाउँछ।स्टेप–० निदान। एउटै शब्दको छुट्टै र निरन्तर रूप दाँजेर ३७ मानव-पुष्टि उदाहरणमा प्रतिनिधित्व ३५% मात्र जोगिएको निष्कर्ष निस्कियो।विशेषज्ञ मिलान सम्पादक। समीक्षकले सही शब्द टाइप गर्न, IN/OUT तान्न, पुष्टि गर्न वा “साइन छैन/अनिश्चित” छान्न सक्नुहुन्छ। भिडियो सार्वजनिक चित्रमा हटाइएको छ।समुदाय डाटा स्टुडियो। सुरुवाती समयको ६५% मौजुदा निरन्तर क्लिप मिलाउन र ३५% लक्षित नयाँ उदाहरण रेकर्ड गर्न प्रस्ताव गरिएको छ।RTMPose पछि देखिने चाल। प्रत्येक सानो आकृति एउटा समयको शरीर/हात नक्सा हो। यसले पहिचानयोग्य फोटोभन्दा चाल जोगाउँछ, तर अर्थ वा सही संकेत सीमा आफैँ बताउँदैन।
सार्वजनिक दृश्य नीति: ड्यासबोर्ड उत्पादनमा निजी नेटवर्कमै रहन्छ। यहाँ स्थिर, सफा गरिएको चित्र मात्र राखिएको छ—कुनै सहभागी कोड, आन्तरिक भिडियो आईडी, सम्पर्क विवरण वा योगदान फाइल सार्वजनिक गरिएको छैन।
अहिलेको अवस्था
छुट्टै र स्पष्ट संकेतमा वास्तविक पहिचान क्षमता देखिएको छ। प्राकृतिक निरन्तर साइनमा समय-सीमा, भिन्न रूप र सह-संकेत अझै मुख्य बाधा हुन्।
शब्दकोश-जस्तो छुट्टै संकेतलाई ३,६५३ सम्भावित अवधारणामध्ये खोज्दा स्थिर मोडेलको शीर्ष–५ सही दर ३०.१% छ। त्यही प्रतिनिधित्व प्राकृतिक निरन्तर साइनमा राख्दा दर ५.४% मा झर्छ।
चरण ४ ले एउटा विशेष बहु-झ्याल खोज विधिमा १६.२% पुर्यायो। चरण ५ को निरन्तर-अनुकूलित मोडेलले पूर्वनिर्धारित १०% सफलता सीमा पार गरेन।
तर हाम्रै आन्तरिक लेखापरीक्षणले देखायो, त्यो सीमा आफैँ तथ्याङ्कीय रूपमा कमजोर थियो: ३७ उदाहरणको सानो नमुनामा साँच्चै दोब्बर सुधार भएको भए पनि त्यो सीमा आधा जति पटक मात्र पार हुन्थ्यो। त्यसैले चरण ५ को असफलताले “मेसिन आफैँले पुग्दैन” भन्ने कुरा प्रमाणित गर्दैन — यो प्रश्न परीक्षण नै भएको थिएन।
चरण ६ मा तीन फरक तालिम विधि परीक्षण गरियो। तीनै विधि आफ्नै पूर्वनिर्धारित वैधता जाँचमा असफल भए, त्यसैले कुनै पनि नतिजा अंक निकालिएन।
अहिलेको इमानदार अवस्था: निरन्तर साइनको बाधा तालिम-विधिको कमजोरीले हो कि मानवले मिलाएको उदाहरणको अभावले — यो अझै खुला प्रश्न हो। यो प्रश्न मेसिनले आफैँ छिन्न सक्दैन, किनभने हाम्रा लेबल त्यही स्वचालित प्रक्रियाबाटै आएका हुन्। यसैले नेपाली साङ्केतिक भाषा प्रयोग गर्ने समुदायको प्रत्यक्ष सहभागिता आवश्यक छ।
तयार भएको आधार
११९.६ घण्टा
निरन्तर साइनको पोज डाटा; १०.८ लाखभन्दा बढी प्रशिक्षण झ्याल।
३,६५३ अवधारणा
शब्द वा अवधारणाबाट सन्दर्भ संकेत खोज्न मिल्ने ग्यालरी।
२१९ उदाहरण
मानव-पुष्टि भएको छुट्टै संकेत मूल्याङ्कन सेट; तालिमबाट अलग राखिएको।
३७ उदाहरण
मानव-पुष्टि भएको निरन्तर साइन मूल्याङ्कन सेट; परिवर्तन नहुने गरी स्थिर राखिएको।
४८९ खण्ड
९७ भिडियोबाट १.२१ घण्टाको सीटीसी सामग्री; ३०५ खण्डमा कम्तीमा दुई मुख्य अवधारणा।
८३८ कार्ड
हरिको उच्च-विश्वसनीयता भएको ५३५ अवधारणाको छुट्टै संकेत सन्दर्भ।
मुख्य मोडेल नतिजा
क्षमता छ, तर उत्पादन तयार छैन।
शीर्ष–५ सही खोज दर: सही अवधारणा मोडेलले दिएको पहिलो पाँच परिणामभित्र परेको अनुपात।
परीक्षण
शीर्ष–५
इमानदार अर्थ
छुट्टै संकेत · स्थिर आधार
३०.१%
सफा, शब्दकोश-जस्तो संकेतमा उपयोगी खोज क्षमता।
निरन्तर संकेत · स्थिर आधार
५.४%
छुट्टै संकेतको क्षमता प्राकृतिक साइनमा सीधै सर्दैन।
चरण ४ · कच्चा बहु-झ्याल
१६.२%
०.६ सेकेन्डका बहु-झ्यालमा पुनःजाँच गरिएको अहिलेको सञ्चालन आधार।
चरण ५ · मिल्दो ग्यालरी
५.४%
३७ मध्ये २ मात्र; पूर्वनिर्धारित १०% सीमा असफल।
मुख्य पाठ: निरन्तर साइन बुझ्न मोडेललाई निरन्तर साइनमै मानवले मिलाएको अर्थ र सही सुरु/अन्त्य समय चाहिन्छ।
निरन्तर मूल्याङ्कनमा ३७ उदाहरण मात्र भएकाले प्रतिशतलाई दिशा देखाउने प्रमाणका रूपमा पढ्नुपर्छ, पूर्ण भाषानुवाद वा वास्तविक समयको विश्वसनीयता भनेर होइन।
समुदायसँग गर्नुपर्ने काम
पहिलो प्राथमिकता नयाँ भिडियोभन्दा मौजुदा निरन्तर भिडियोको सही मिलान हो। नयाँ रेकर्डिङले त्यसपछि महत्त्वपूर्ण भिन्न रूप र खाली अवधारणा भर्छ।
पहिलो समीक्षा सत्र ६०–९० मिनेटको हुनेछ। अनुभवी नेपाली साङ्केतिक भाषा प्रयोगकर्ता वा दोभाषेले साधारण वेब पृष्ठमा क्लिप हेरेर अर्थ, भिन्न रूप र सुरु/अन्त्य समय जाँच्नुहुनेछ।
०१ / अहिले
मौजुदा क्लिप मिलाउने
७० छोटा क्लिप, ४० भिडियो र ४५ अवधारणा तयार छन्।
पहिलो सत्रमा ३०–४० क्लिप समीक्षा गर्ने लक्ष्य छ।
अर्थ, क्षेत्रीय/प्रचलित भिन्न रूप र साइनको ठीक समय-सीमा सच्याउने।
प्रत्येक तालिमयोग्य क्लिपमा दुई स्वतन्त्र समीक्षकको सहमति लिने।
०२ / त्यसपछि
लक्षित नयाँ रेकर्डिङ
३० अवधारणाका ६० रेकर्डिङ कार्य पहिल्यै तयार छन्।
प्रत्येक अवधारणाको छुट्टै रूप र प्राकृतिक वाक्यभित्रको प्रयोग लिने।
मोडेल असफल भएका अवधारणा र समुदायले देखाएका भिन्न रूपलाई प्राथमिकता दिने।
शब्दशः नेपाली अनुवादभन्दा प्राकृतिक नेपाली साङ्केतिक भाषा व्याकरणलाई मान्यता दिने।
हामीलाई अहिले चाहिएको सहयोग
एक वा दुई अनुभवी समीक्षक—सम्भव भए कम्तीमा एक जना मातृभाषी वा दैनिक नेपाली साङ्केतिक भाषा प्रयोगकर्ता। उचित पारिश्रमिक, छोटो उपकरण अभ्यास र अनलाइन वा प्रत्यक्ष सत्रको व्यवस्था परियोजनाले गर्छ।
डाटा र समीक्षा नियम
मानव-पुष्टि मूल्याङ्कन डाटा तालिममा मिसाइँदैन।
नयाँ रेकर्डिङ स्पष्ट सहमतिपछि मात्र लिइन्छ।
उपकरणले कानुनी नाम, फोन वा ठेगाना माग्दैन; छद्म सहभागी कोड पर्याप्त हुन्छ।
मानवले दिएको मूल्याङ्कन अलग र थपिने क्रममै राखिन्छ; मेसिनले स्वतः परिवर्तन गर्दैन।
क्षेत्रीय, प्रचलित, औँला-हिज्जे वा संयुक्त रूपलाई गलत भनेर मेटाइँदैन; छुट्टै टिपोट गरिन्छ।
कुनै क्लिप तालिममा जानुअघि दुई स्वतन्त्र समीक्षाको सहमति चाहिन्छ।