ampixa / nsl research

अनुसन्धानअद्यावधिक · १४ जुलाई २०२६

सफा संकेतबाट निरन्तर साइनसम्म।

नेपाली साङ्केतिक भाषा पहिचान गर्न हामीले तयार गरेको डाटा, मोडेल नतिजा, असफलता र अब समुदायसँग गर्नुपर्ने कामको खुला अभिलेख।


हामी कहाँबाट सुरु गर्‍यौँ

यो काम सिधै “अनुवाद गर्ने एआई” बाट सुरु भएको होइन। हामीले पहिले एउटा स्पष्ट संकेत के जस्तो देखिन्छ भन्ने आधार बनायौँ, त्यसपछि मात्र प्राकृतिक निरन्तर साइनतर्फ गयौँ।

०१ / शब्दकोश

३,६५३ छुट्टाछुट्टै संकेतबाट पहिलो सन्दर्भ

शब्दकोश भिडियोमा एक पटकमा प्रायः एउटै अवधारणा सफा रूपमा देखाइन्छ। तिनलाई शब्द/अवधारणाअनुसार मिलाएर हामीले खोज ग्यालरी बनायौँ। यही ग्यालरीले “यो चाल कुन ज्ञात संकेतसँग सबैभन्दा मिल्छ?” भन्ने पहिलो प्रश्नको उत्तर दिन्छ।

सरल भाषामा: यो फोटोसहितको शब्दकोशजस्तै हो—वाक्य बुझ्दैन, तर स्पष्ट संकेत दाँज्न उपयोगी हुन्छ।

०२ / संसद

त्यसपछि प्राकृतिक, लगातार गरिएको साइन हेर्‍यौँ

संसद प्रसारणमा दोभाषेले वाक्यको अर्थसँगै लगातार साइन गर्नुहुन्छ। एउटा संकेत कहाँ सकियो र अर्को कहाँ सुरु भयो भन्ने सफा काट हुँदैन; हातको आकार, स्थान, अनुहार र गति छेउका संकेतसँग मिसिन्छ। बोलिएको क्याप्सन पनि साइनको शब्दशः समयरेखा होइन, त्यसैले त्यसलाई सत्य लेबल नभई सम्भावित सङ्केत मात्र मान्यौँ।

सरल भाषामा: शब्दकोशमा शब्द छुट्टाछुट्टै छन्; संसदमा ती बोल्दा जस्तै एक-अर्कामा बग्छन्।

०३ / Uni-Sign

अरू साङ्केतिक भाषाबाट सिकेको दृश्य प्रतिनिधित्व प्रयोग गर्‍यौँ

Uni-Sign अनुसन्धान ले ठूलो परिमाणको साइन भिडियोबाट शरीर, हात, अनुहार र दृश्यलाई उपयोगी प्रतिनिधित्वमा बदल्न सकिने देखायो। हामीले त्यसको पूर्व-प्रशिक्षित पोज भागलाई स्थिर आधारका रूपमा प्रयोग गर्‍यौँ—यसलाई नेपाली साङ्केतिक भाषा स्वतः जान्ने अनुवादक मानेनौँ।

सरल भाषामा: यसले चालको “डिजिटल औँठाछाप” बनाउँछ; त्यस औँठाछापको नेपाली अर्थ छुट्टै डाटा र मानव समीक्षाबाट सिकाउनुपर्छ।

०४ / RTMPose

भिडियोबाट शरीर र हातका बिन्दु निकाल्यौँ

RTMPose ले प्रत्येक फ्रेममा शरीर, हात र अनुहार कहाँ छन् भन्ने मुख्य बिन्दु पत्ता लगाउँछ। यसरी पृष्ठभूमि, कपडा वा भिडियो शैलीभन्दा चालको समयक्रममा ध्यान दिन सकिन्छ। तर यी बिन्दुले आफैँ “अर्थ” जान्दैनन् र औँला छोपिएको वा फ्रेम धमिलो भएको ठाउँमा गल्ती गर्न सक्छन्।

सरल भाषामा: यसले मानिसको चलिरहेको काँटामानचित्र बनाउँछ—नक्सा बनाउँछ, भाषा बुझ्दैन।

०५ / पहिलो पुल

शब्दकोशको संकेत संसदमा खोज्ने प्रयास गर्‍यौँ

पोजको छोटो झ्याललाई Uni-Sign प्रतिनिधित्वमा बदलेर ३,६५३ संकेतको ग्यालरीसँग दाँज्यौँ। सफा शिक्षण संकेतमा उपयोगी क्षमता देखियो, तर संसदका ७८७ सम्भावित खण्डमा नजिकको बोलीसँग शीर्ष–५ सहमति करिब २% मात्र रह्यो। त्यसैले स्वतः संसद लेबल गर्ने योजना रोकेर समस्याको कारण मापन गर्न थाल्यौँ।

सरल भाषामा: शब्दकोशको फोटो चिन्न सक्ने प्रणालीले स्वाभाविक कुराकानी तुरुन्त बुझेन।

०६ / मानव मिलान

ड्यासबोर्ड बनाएर अर्थ र ठीक समय-सीमा जाँच्यौँ

शब्दकोश सन्दर्भ र निरन्तर क्लिप सँगसँगै देखाएर समीक्षकले संकेत उपस्थित छ/छैन भन्न, सही शब्द सच्याउन र IN/OUT ह्यान्डल तानेर सुरु-अन्त्य मिलाउन सक्ने उपकरण बनायौँ। यही प्रक्रियाबाट २१९ छुट्टै र ३७ निरन्तर मानव-पुष्टि मूल्याङ्कन उदाहरण बने।

सरल भाषामा: मेसिनले सम्भावित ठाउँ देखाउँछ; भाषा जान्ने मानिसले के भयो र कहिले भयो भन्ने अन्तिम निर्णय गर्छ।

०७ / निरन्तर तालिम

११९.६ घण्टा चालबाट निरन्तर प्रतिनिधित्व सुधार्ने प्रयास

संसदको ११९.६ घण्टा पोजलाई लेबलविहीन चाल सिकाइमा, र ४८९ शिक्षण खण्डलाई सीमित क्रम-सिकाइमा प्रयोग गर्‍यौँ। पाँच चरणका परीक्षणले सानो सुधार देखाए तर पूर्वनिर्धारित सफलता सीमा पार गरेनन्। अहिलेको बाधा कम्प्युट मात्र होइन—विश्वसनीय निरन्तर अर्थ र समय-मिलान हो।

सरल भाषामा: धेरै भिडियो हुनु पर्याप्त भएन; सही ठाउँमा सही अर्थ जोडिएको उदाहरण चाहियो।


प्रयोगमा विधि कसरी चल्छ

भिडियो सिधै शब्द बन्दैन। बीचमा चाल निकाल्ने, छोटो समय-झ्याल बनाउने, समानता खोज्ने, मानिसले मिलाउने र अलग परीक्षण गर्ने चरण छन्।

०१

स्रोत छुट्याउने

शब्दकोश, शिक्षण भिडियो र संसद प्रसारणलाई एउटै प्रकारको डाटा मानिँदैन। प्रत्येकको भूमिका र भरोसा छुट्टै लेखिन्छ।

०२

RTMPose पोज

फ्रेम-फ्रेमबाट शरीर, हात र अनुहारका बिन्दु निकालेर समयसँगै चलेको पोज बनाइन्छ।

०३

समय-झ्याल

निरन्तर चाललाई साना, एक-अर्कामाथि केही खप्टिने झ्यालमा काटिन्छ ताकि संकेतको सम्भावित सीमा नछुटोस्।

०४

Uni-Sign प्रतिनिधित्व

हरेक झ्याललाई तुलना गर्न मिल्ने सङ्ख्यात्मक प्रतिनिधित्वमा बदलिन्छ; नजिकका चालहरू नजिक पर्ने प्रयास हुन्छ।

०५

खोज र उम्मेदवार

प्रतिनिधित्वलाई ३,६५३ शब्दकोश सन्दर्भसँग दाँजेर सम्भावित अर्थ र समय निकालिन्छ। यो सुझाव हो, सत्य लेबल होइन।

०६

मानव IN/OUT मिलान

समीक्षकले भिडियो हेरेर अर्थ, भिन्न रूप र साइनको सही सुरु/अन्त्य सच्याउनुहुन्छ।

०७

तालिम

लेबल नभएको संसद पोजबाट चालको ढाँचा र मानव-मिलान शिक्षण खण्डबाट अवधारणाको क्रम सिकाइन्छ।

०८

स्थिर मूल्याङ्कन

२१९ छुट्टै र ३७ निरन्तर उदाहरण तालिमबाट अलग रहन्छन्; मोडेल सकिएपछि मात्र नतिजा जाँचिन्छ।

महत्त्वपूर्ण सीमा: संसदको बोली/क्याप्सन समय पत्ता लगाउने सङ्केत हुन सक्छ, तर नेपाली साङ्केतिक भाषाको शब्दशः सत्य मानिँदैन। मानव-पुष्टि नभएको क्याप्सन मूल्याङ्कन लेबल बन्दैन।

वास्तविक उपकरण र दृश्य

यी परियोजनाकै चलिरहेका ड्यासबोर्ड र पोज आउटपुट हुन्। सार्वजनिक चित्रका लागि आन्तरिक स्रोत पहिचान हटाइएको छ र व्यक्तिको अनुहार छोपिएको छ; हात, शरीर, समयरेखा र नतिजा जस्ताको तस्तै राखिएका छन्।

बायाँ शब्दकोश संकेत र बीचमा संसद प्रसारणको साइन राखेर IN र OUT समय मिलाउने ड्यासबोर्ड; अनुहार छोपिएको
शब्दकोश → संसद मिलान। बायाँ स्पष्ट सन्दर्भ, बीचमा प्रसारणको प्राकृतिक संकेत, तल फ्रेम र IN/OUT नियन्त्रण। यही दृश्यले एउटै अवधारणा छुट्टै र वाक्यभित्र कति फरक देखिन्छ भन्ने देखाउँछ।
छुट्टै र निरन्तर संकेत दाँजेर निरन्तर अवस्थामा पहिचान घटेको देखाउने स्टेप शून्य ड्यासबोर्ड; अनुहार छोपिएको
स्टेप–० निदान। एउटै शब्दको छुट्टै र निरन्तर रूप दाँजेर ३७ मानव-पुष्टि उदाहरणमा प्रतिनिधित्व ३५% मात्र जोगिएको निष्कर्ष निस्कियो।
शब्दकोश र शिक्षण क्लिपसँगै राखेर समयरेखामा IN र OUT तान्ने विशेषज्ञ मिलान सम्पादक
विशेषज्ञ मिलान सम्पादक। समीक्षकले सही शब्द टाइप गर्न, IN/OUT तान्न, पुष्टि गर्न वा “साइन छैन/अनिश्चित” छान्न सक्नुहुन्छ। भिडियो सार्वजनिक चित्रमा हटाइएको छ।
मौजुदा निरन्तर क्लिप समीक्षा र नयाँ साइन रेकर्डिङका दुई बाटा देखाउने समुदाय डाटा स्टुडियो
समुदाय डाटा स्टुडियो। सुरुवाती समयको ६५% मौजुदा निरन्तर क्लिप मिलाउन र ३५% लक्षित नयाँ उदाहरण रेकर्ड गर्न प्रस्ताव गरिएको छ।
क्रमिक भिडियो फ्रेमबाट निकालिएका शरीर र हातका पोज बिन्दुको सम्पर्क पाना
RTMPose पछि देखिने चाल। प्रत्येक सानो आकृति एउटा समयको शरीर/हात नक्सा हो। यसले पहिचानयोग्य फोटोभन्दा चाल जोगाउँछ, तर अर्थ वा सही संकेत सीमा आफैँ बताउँदैन।

सार्वजनिक दृश्य नीति: ड्यासबोर्ड उत्पादनमा निजी नेटवर्कमै रहन्छ। यहाँ स्थिर, सफा गरिएको चित्र मात्र राखिएको छ—कुनै सहभागी कोड, आन्तरिक भिडियो आईडी, सम्पर्क विवरण वा योगदान फाइल सार्वजनिक गरिएको छैन।


अहिलेको अवस्था

छुट्टै र स्पष्ट संकेतमा वास्तविक पहिचान क्षमता देखिएको छ। प्राकृतिक निरन्तर साइनमा समय-सीमा, भिन्न रूप र सह-संकेत अझै मुख्य बाधा हुन्।

शब्दकोश-जस्तो छुट्टै संकेतलाई ३,६५३ सम्भावित अवधारणामध्ये खोज्दा स्थिर मोडेलको शीर्ष–५ सही दर ३०.१% छ। त्यही प्रतिनिधित्व प्राकृतिक निरन्तर साइनमा राख्दा दर ५.४% मा झर्छ।

चरण ४ ले एउटा विशेष बहु-झ्याल खोज विधिमा १६.२% पुर्‍यायो। चरण ५ को निरन्तर-अनुकूलित मोडेलले पूर्वनिर्धारित १०% सफलता सीमा पार गरेन।

तर हाम्रै आन्तरिक लेखापरीक्षणले देखायो, त्यो सीमा आफैँ तथ्याङ्कीय रूपमा कमजोर थियो: ३७ उदाहरणको सानो नमुनामा साँच्चै दोब्बर सुधार भएको भए पनि त्यो सीमा आधा जति पटक मात्र पार हुन्थ्यो। त्यसैले चरण ५ को असफलताले “मेसिन आफैँले पुग्दैन” भन्ने कुरा प्रमाणित गर्दैन — यो प्रश्न परीक्षण नै भएको थिएन।

चरण ६ मा तीन फरक तालिम विधि परीक्षण गरियो। तीनै विधि आफ्नै पूर्वनिर्धारित वैधता जाँचमा असफल भए, त्यसैले कुनै पनि नतिजा अंक निकालिएन।

अहिलेको इमानदार अवस्था: निरन्तर साइनको बाधा तालिम-विधिको कमजोरीले हो कि मानवले मिलाएको उदाहरणको अभावले — यो अझै खुला प्रश्न हो। यो प्रश्न मेसिनले आफैँ छिन्न सक्दैन, किनभने हाम्रा लेबल त्यही स्वचालित प्रक्रियाबाटै आएका हुन्। यसैले नेपाली साङ्केतिक भाषा प्रयोग गर्ने समुदायको प्रत्यक्ष सहभागिता आवश्यक छ।


तयार भएको आधार

११९.६ घण्टानिरन्तर साइनको पोज डाटा; १०.८ लाखभन्दा बढी प्रशिक्षण झ्याल।
३,६५३ अवधारणाशब्द वा अवधारणाबाट सन्दर्भ संकेत खोज्न मिल्ने ग्यालरी।
२१९ उदाहरणमानव-पुष्टि भएको छुट्टै संकेत मूल्याङ्कन सेट; तालिमबाट अलग राखिएको।
३७ उदाहरणमानव-पुष्टि भएको निरन्तर साइन मूल्याङ्कन सेट; परिवर्तन नहुने गरी स्थिर राखिएको।
४८९ खण्ड९७ भिडियोबाट १.२१ घण्टाको सीटीसी सामग्री; ३०५ खण्डमा कम्तीमा दुई मुख्य अवधारणा।
८३८ कार्डहरिको उच्च-विश्वसनीयता भएको ५३५ अवधारणाको छुट्टै संकेत सन्दर्भ।

मुख्य मोडेल नतिजा

क्षमता छ, तर उत्पादन तयार छैन।

शीर्ष–५ सही खोज दर: सही अवधारणा मोडेलले दिएको पहिलो पाँच परिणामभित्र परेको अनुपात।

परीक्षणशीर्ष–५इमानदार अर्थ
छुट्टै संकेत · स्थिर आधार ३०.१% सफा, शब्दकोश-जस्तो संकेतमा उपयोगी खोज क्षमता।
निरन्तर संकेत · स्थिर आधार ५.४% छुट्टै संकेतको क्षमता प्राकृतिक साइनमा सीधै सर्दैन।
चरण ४ · कच्चा बहु-झ्याल १६.२% ०.६ सेकेन्डका बहु-झ्यालमा पुनःजाँच गरिएको अहिलेको सञ्चालन आधार।
चरण ५ · मिल्दो ग्यालरी ५.४% ३७ मध्ये २ मात्र; पूर्वनिर्धारित १०% सीमा असफल।
मुख्य पाठ: निरन्तर साइन बुझ्न मोडेललाई निरन्तर साइनमै मानवले मिलाएको अर्थ र सही सुरु/अन्त्य समय चाहिन्छ।

निरन्तर मूल्याङ्कनमा ३७ उदाहरण मात्र भएकाले प्रतिशतलाई दिशा देखाउने प्रमाणका रूपमा पढ्नुपर्छ, पूर्ण भाषानुवाद वा वास्तविक समयको विश्वसनीयता भनेर होइन।


समुदायसँग गर्नुपर्ने काम

पहिलो प्राथमिकता नयाँ भिडियोभन्दा मौजुदा निरन्तर भिडियोको सही मिलान हो। नयाँ रेकर्डिङले त्यसपछि महत्त्वपूर्ण भिन्न रूप र खाली अवधारणा भर्छ।

पहिलो समीक्षा सत्र ६०–९० मिनेटको हुनेछ। अनुभवी नेपाली साङ्केतिक भाषा प्रयोगकर्ता वा दोभाषेले साधारण वेब पृष्ठमा क्लिप हेरेर अर्थ, भिन्न रूप र सुरु/अन्त्य समय जाँच्नुहुनेछ।

०१ / अहिले

मौजुदा क्लिप मिलाउने

  • ७० छोटा क्लिप, ४० भिडियो र ४५ अवधारणा तयार छन्।
  • पहिलो सत्रमा ३०–४० क्लिप समीक्षा गर्ने लक्ष्य छ।
  • अर्थ, क्षेत्रीय/प्रचलित भिन्न रूप र साइनको ठीक समय-सीमा सच्याउने।
  • प्रत्येक तालिमयोग्य क्लिपमा दुई स्वतन्त्र समीक्षकको सहमति लिने।
०२ / त्यसपछि

लक्षित नयाँ रेकर्डिङ

  • ३० अवधारणाका ६० रेकर्डिङ कार्य पहिल्यै तयार छन्।
  • प्रत्येक अवधारणाको छुट्टै रूप र प्राकृतिक वाक्यभित्रको प्रयोग लिने।
  • मोडेल असफल भएका अवधारणा र समुदायले देखाएका भिन्न रूपलाई प्राथमिकता दिने।
  • शब्दशः नेपाली अनुवादभन्दा प्राकृतिक नेपाली साङ्केतिक भाषा व्याकरणलाई मान्यता दिने।

हामीलाई अहिले चाहिएको सहयोग

एक वा दुई अनुभवी समीक्षक—सम्भव भए कम्तीमा एक जना मातृभाषी वा दैनिक नेपाली साङ्केतिक भाषा प्रयोगकर्ता। उचित पारिश्रमिक, छोटो उपकरण अभ्यास र अनलाइन वा प्रत्यक्ष सत्रको व्यवस्था परियोजनाले गर्छ।


डाटा र समीक्षा नियम