ဒစ်ဂျစ်တယ် တိမ်ကောမှုအန္တရာယ်မှသည် အနာဂတ်ဆီသို့ — AI ခေတ်မှာ မြန်မာဘာသာစကား မပျောက်ကွယ်အောင် လူငယ်တွေ ဘာတွေ ဝိုင်းဝန်းလုပ်ဆောင်နိုင်သလဲ
ကမ္ဘာကြီးက AI နည်းပညာတွေနဲ့ ရှေ့ကို အရှိန်အဟုန်ပြင်းပြင်း ပြေးနေချိန်မှာ ကျွန်ုပ်တို့ရဲ့ မိခင်ဘာသာစကား နောက်ကျကျန်မနေရစ်စေဖို့ မျိုးဆက်သစ်လူငယ်တွေ လက်တွေ့ ပါဝင်လုပ်ဆောင်နိုင်မယ့် နည်းလမ်းများနှင့် အခွင့်အလမ်းများ
ယနေ့ခေတ် ကမ္ဘာကြီးမှာ ဉာဏ်ရည်တု (AI) နည်းပညာတွေဟာ မယုံနိုင်စရာ ကောင်းလောက်အောင် နေ့စဉ်နဲ့အမျှ တိုးတက်ပြောင်းလဲနေပါတယ်။ စာရေးတာ၊ ပုံဆွဲတာ၊ ဆော့ဖ်ဝဲကုဒ်ရေးတာကအစ သိပ္ပံဆိုင်ရာ သုတေသနတွေအထိ AI ကို လက်တွေ့ကျကျ တွင်တွင်ကျယ်ကျယ် အသုံးချနေကြပါပြီ။ ဒါပေမယ့် ဒီနည်းပညာ တော်လှန်ရေးကြီးရဲ့ နောက်ကွယ်မှာ အသံတိတ် စိန်ခေါ်မှုကြီးတစ်ခု ရှိနေပါတယ်။
အဲဒါကတော့ “ဘာသာစကားဆိုင်ရာ ဒစ်ဂျစ်တယ် တိမ်ကောမှု (Digital Extinction)” ပါပဲ။
သမိုင်းတစ်လျှောက်မှာ စာပေအမွေအနှစ် ဘယ်လောက်ပဲ ကြွယ်ဝခဲ့ပါစေ၊ နည်းပညာခေတ် အပြောင်းအလဲမှာ စက်တွေ၊ ကွန်ပျူတာတွေနဲ့ AI စနစ်တွေထဲ စနစ်တကျ အမြစ်မတွယ်နိုင်ခဲ့တဲ့ ဘာသာစကား အများအပြားဟာ လူသုံးနည်းလာပြီး တဖြည်းဖြည်း မှေးမှိန်ပျောက်ကွယ်သွားခဲ့ကြဖူးပါတယ်။ အခု ရောက်ရှိနေတဲ့ AI ခေတ်မှာလည်း အင်တာနက်ပေါ်မှာ စံနှုန်းမီ ဒစ်ဂျစ်တယ် အချက်အလက် (Data) မလုံလောက်တဲ့ မြန်မာလို ရင်းမြစ်နည်း ဘာသာစကား (Low-Resource Language) တွေဟာ အလားတူ အန္တရာယ်မျိုးနဲ့ ရင်ဆိုင်နေရပါတယ်။
ဒီအခြေအနေမှာ အနာဂတ်ကို ပုံဖော်မယ့် မျိုးဆက်သစ် လူငယ်တွေအနေနဲ့ “ဒါ ငါတို့နဲ့ မဆိုင်ပါဘူး၊ နိုင်ငံတကာ ကုမ္ပဏီကြီးတွေ ဒါမှမဟုတ် ပညာရှင်တွေပဲ လုပ်ရမယ့်အလုပ်” လို့ ဘေးထိုင်ကြည့်နေလို့ မရတော့ပါဘူး။ မိခင်ဘာသာစကား မပျောက်ကွယ်စေဖို့အတွက် လူငယ်တစ်ယောက်ချင်းစီရဲ့ လက်ထဲမှာ လုပ်ဆောင်နိုင်တဲ့ လက်တွေ့ကျတဲ့ စွမ်းအားတွေ အများကြီး ရှိနေပါတယ်။
၁။ အင်တာနက်ပေါ်မှာ သန့်ရှင်းတဲ့ ယူနီကုဒ် (Unicode) ဒေတာတွေ ဖန်တီးပါ
AI မော်ဒယ်တွေဟာ အင်တာနက်ပေါ်က စာသားတွေကို ဖတ်ရှုပြီး သင်ယူကြတာ ဖြစ်ပါတယ်။ ဒါကြောင့် လူငယ်တွေအနေနဲ့ လူမှုကွန်ရက်၊ ဘလော့ဂ် ဒါမှမဟုတ် ဝဘ်ဆိုဒ်တွေပေါ်မှာ စာရေးတဲ့အခါ နိုင်ငံတကာ စံနှုန်းမီ ယူနီကုဒ် (Unicode) စနစ်ကို မဖြစ်မနေ အသုံးပြုဖို့ လိုအပ်ပါတယ်။
ဒါတင်မကသေးဘဲ စာလုံးပေါင်း သတ်ပုံတွေကို တတ်နိုင်သမျှ စနစ်တကျ မှန်ကန်အောင် ရေးသားတာ၊ အမုန်းစကားတွေ မဟုတ်တဲ့ အသိပညာဗဟုသုတ မျှဝေတဲ့ အကြောင်းအရာတွေကို မြန်မာလို များများ ရေးသားဖန်တီးပေးတာဟာ AI တွေအတွက် အရည်အသွေးမြင့် စာသားဒေတာတွေကို မသိမသာ ဝိုင်းဝန်း ဖြည့်ဆည်းပေးနေတာ ဖြစ်ပါတယ်။
၂။ မြန်မာဝီကီပီးဒီးယားတွင် စေတနာ့ဝန်ထမ်းအဖြစ် ဝင်ရောက် ရေးသားပါ
လက်ရှိ ကမ္ဘာကျော် LLM တွေဟာ မြန်မာစာနဲ့ ပတ်သက်တဲ့ အသိပညာကို Burmese Wikipedia ကနေ အဓိက မှီငြမ်းသင်ယူနေရတာ ဖြစ်ပါတယ်။ ဒါပေမယ့် မြန်မာဝီကီပီးဒီးယားမှာ ဆောင်းပါး အရေအတွက် အလွန်နည်းပါးနေဆဲပါ။
စာဖတ်ဝါသနာပါတဲ့၊ ဘာသာပြန် ဝါသနာပါတဲ့ လူငယ်တွေအနေနဲ့ မိမိတို့ စိတ်ဝင်စားတဲ့ နယ်ပယ် (သိပ္ပံ၊ နည်းပညာ၊ သမိုင်း၊ ရုပ်ရှင်၊ အားကစား၊ စာပေ) ဆိုင်ရာ အကြောင်းအရာတွေကို အင်္ဂလိပ်ဝီကီပီးဒီးယားကနေ မြန်မာလို ဘာသာပြန်ပြီး ရေးသားတာ၊ ရှိပြီးသား စာမျက်နှာတွေကို အချက်အလက် ဖြည့်စွက်တည်းဖြတ်ပေးတာမျိုး လုပ်ဆောင်နိုင်ပါတယ်။ ဒါဟာ နောင်လာမယ့် AI တွေအတွက် အဖိုးတန်တဲ့ အသိပညာ ဗဟုသုတအစုအဝေး (Knowledge Base) ကို တည်ဆောက်ပေးတာ ဖြစ်ပါတယ်။
၃။ Open Data နှင့် NLP အသိုက်အဝန်းများတွင် တက်ကြွစွာ ပါဝင်ချိတ်ဆက်ပါ
AI အတွက် မြန်မာစာ ဒေတာတွေ စနစ်တကျ ရှိလာဖို့ဆိုတာ တစ်ဦးချင်းစီ သီးခြား လုပ်နေရုံနဲ့ မလုံလောက်ပါဘူး။ ပြည်တွင်းက ပွင့်လင်းရင်းမြစ် (Open Source) လှုပ်ရှားမှုတွေ၊ Data Platform တွေနဲ့ လက်တွဲ ပူးပေါင်းကြဖို့ လိုအပ်ပါတယ်။
ဒီနေရာမှာ လူငယ်တွေ လက်တွေ့ ဝင်ရောက်ပူးပေါင်းနိုင်တဲ့ အဓိက အသိုက်အဝန်းတစ်ခုကတော့ DatarrX (ဒေတာ-အက်စ်) ပဲ ဖြစ်ပါတယ်။
DatarrX ဟာ မြန်မာစာနဲ့ တိုင်းရင်းသား ဘာသာစကားများဆိုင်ရာ NLP နည်းပညာ တိုးတက်စေဖို့နဲ့ အရည်အသွေးမြင့် Dataset တွေ တည်ဆောက်ဖို့ ရည်ရွယ်ထားတဲ့ အကျိုးအမြတ်မယူသော ပွင့်လင်းရင်းမြစ် ဖောင်ဒေးရှင်းတစ်ခု ဖြစ်ပါတယ်။ datarrx.org ကတစ်ဆင့် လူငယ်တွေအနေနဲ့ မိမိတို့ ကျွမ်းကျင်ရာ ကဏ္ဍအလိုက် အောက်ပါအတိုင်း ဝင်ရောက် အကျိုးပြုနိုင်ပါတယ် -
- စာသားနှင့် အသံ ဒေတာများ စုဆောင်း/ဖတ်ကြားပေးခြင်း — စာကြောင်းများ ဘာသာပြန်ခြင်း၊ အသံထွက်ဖတ်ကြားပေးခြင်းဖြင့် Speech & Text Dataset များ ပေါ်ထွက်လာအောင် ကူညီခြင်း။
- ဒေတာ စစ်ဆေးတည်းဖြတ်ခြင်း (Data Annotation/Reviewing) — စုဆောင်းရရှိထားတဲ့ မြန်မာစာ ဝါကျတွေရဲ့ သဒ္ဒါ၊ စာလုံးပေါင်းနဲ့ အဓိပ္ပာယ် မှန်ကန်မှုကို စိစစ်ပေးခြင်း။
- နည်းပညာနှင့် ကုဒ်များ မျှဝေခြင်း — ကွန်ပျူတာသိပ္ပံ ကျောင်းသားများနှင့် Developer များအနေဖြင့် Hugging Face, GitHub စတဲ့ ပလက်ဖောင်းတွေပေါ်မှာ မြန်မာစာဆိုင်ရာ Tools များ၊ Script များကို Open Source အဖြစ် ဝိုင်းဝန်း ရေးသားပံ့ပိုးခြင်း။
- နည်းပညာစာတမ်းများ ဘာသာပြန်ဆိုခြင်း — ခေတ်မီ AI သုတေသန စာတမ်းများကို မြန်မာဘာသာသို့ ပြန်ဆိုပြီး အများပြည်သူ နည်းပညာ အသိအမြင် ကြွယ်ဝစေရန် မျှဝေခြင်း။
၄။ ဘာသာစကားဆိုင်ရာ ဂုဏ်ယူမှုနှင့် နေ့စဉ် နည်းပညာသုံးစွဲမှု အလေ့အထ
နောက်ဆုံးနဲ့ အရေးအကြီးဆုံး အချက်ကတော့ ကျွန်ုပ်တို့ရဲ့ မိခင်ဘာသာစကားအပေါ် ထားရှိတဲ့ စိတ်သဘောထားပါပဲ။ နေ့စဉ် ကွန်ပျူတာနဲ့ ဖုန်းတွေ အသုံးပြုတဲ့အခါ၊ AI Chatbot တွေနဲ့ စကားပြောတဲ့အခါ မြန်မာလို မေးမြန်းစမ်းသပ်တာ၊ အမှားအယွင်းတွေ့ရင် Feedback ပေးတာ စတဲ့ အလေ့အထတွေကို မွေးမြူသင့်ပါတယ်။
ကိုယ့်ရဲ့ ဘာသာစကားကို ဒစ်ဂျစ်တယ် ပလက်ဖောင်းတွေပေါ်မှာ အသုံးမပြုဘဲ ရှောင်ဖယ်ထားမယ်ဆိုရင် နည်းပညာစနစ်တွေကလည်း မြန်မာစာကို အရေးမပါတဲ့ ဘာသာစကားတစ်ခုအဖြစ်ပဲ ဆက်လက် သတ်မှတ်နေမှာ ဖြစ်ပါတယ်။
နိဂုံး
မြန်မာဘာသာစကားကို AI ခေတ်ရဲ့ အလယ်မှာ ဂုဏ်သိက္ခာရှိစွာ ရှင်သန်ကျန်ရစ်စေဖို့ဆိုတာ တကယ်တော့ လူငယ်တစ်ဦးချင်းစီရဲ့ လက်ချောင်းထိပ်တွေကနေ စတင်တာ ဖြစ်ပါတယ်။
သင် ဒီနေ့ ယူနီကုဒ်နဲ့ မှန်ကန်စွာ ရေးလိုက်တဲ့ စာတစ်ကြောင်း၊ ဝီကီပီးဒီးယားမှာ ဖြည့်စွက်လိုက်တဲ့ ဆောင်းပါးတစ်ပိုဒ်၊ datarrx.org မှာ ပါဝင်ပြီး စစ်ဆေးပေးလိုက်တဲ့ ဒေတာတစ်ခုချင်းစီဟာ ကျွန်ုပ်တို့ရဲ့ ဘာသာစကားကို ခေတ်မီ ဉာဏ်ရည်တုလောကထဲမှာ ခိုင်မာစွာ အမြစ်တွယ်စေမယ့် အုတ်မြစ်တွေ ဖြစ်ပါတယ်။
အနာဂတ် ဒစ်ဂျစ်တယ်ကမ္ဘာထဲမှာ မြန်မာစကားသံတွေ ဆက်လက် ပဲ့တင်ထပ်နေစေဖို့အတွက် အခုပဲ စတင်ပြီး တစ်ထောင့်တစ်နေရာကနေ ဝိုင်းဝန်း ပါဝင်ကြပါစို့။