ဒီဂျစ်တယ်ခေတ်ထဲက စကားသံပျောက်များနဲ့ မြန်မာစာ — Low-Resource Language ဆိုတာ ဘာလဲ၊ တို့ဘာသာစကား ဘယ်နားရောက်နေလဲ
AI နဲ့ နည်းပညာတွေ ကမ္ဘာကြီးကို လွှမ်းမိုးလာချိန်မှာ လူသန်းပေါင်းများစွာ ပြောဆိုနေတဲ့ မြန်မာစကားက ဘာကြောင့် 'အရင်းအမြစ်နည်း ဘာသာစကား' ဖြစ်နေရတာလဲဆိုတဲ့ သဘောတရားနဲ့ လက်တွေ့စိန်ခေါ်မှုများအကြောင်း
ယနေ့ခေတ် Artificial Intelligence (AI) နည်းပညာတွေဟာ လူသားတွေရဲ့ နေ့စဉ်ဘဝထဲကို အလျင်အမြန် စိမ့်ဝင်လာနေပါတယ်။ မေးချင်တာမေးရင် စက္ကန့်ပိုင်းအတွင်း ပြန်ဖြေပေးတဲ့ ဉာဏ်ရည်တုတွေ၊ စာရိုက်စရာမလိုဘဲ အသံနဲ့ ခိုင်းစေနိုင်တဲ့ Voice Assistant တွေ၊ တစ်ဘာသာကနေ နောက်တစ်ဘာသာကို သဘာဝကျကျ ချက်ချင်းပြန်ပေးတဲ့ ဘာသာပြန်စနစ်တွေဟာ အံ့ဩစရာကောင်းလောက်အောင် တိုးတက်လာခဲ့ပါပြီ။ ဒါပေမယ့် ဒီနည်းပညာအံ့ဖွယ်တွေကို အင်္ဂလိပ်၊ စပိန် ဒါမှမဟုတ် တရုတ်လို ဘာသာစကားတွေနဲ့ သုံးစွဲတဲ့အခါ အင်မတန် ချောမွေ့နေပေမဲ့ ကိုယ့်ရဲ့ မိခင်ဘာသာစကားဖြစ်တဲ့ မြန်မာစာနဲ့ သုံးကြည့်တဲ့အခါမှာတော့ အဆင်မပြေမှုတွေ၊ လွဲချော်မှုတွေနဲ့ စက်ရုပ်ဆန်ဆန် အသုံးအနှုန်းတွေကို မကြာခဏ ကြုံတွေ့ရတတ်ပါတယ်။
ဒီနေရာမှာ မေးခွန်းတစ်ခု ထွက်ပေါ်လာပါတယ်။ ကမ္ဘာပေါ်မှာ မြန်မာစကားကို မိခင်ဘာသာစကားအဖြစ် ပြောဆိုနေတဲ့ လူဦးရေ သန်း ၃၀ ကျော် ၄၀ နီးပါး ရှိနေပါလျက်နဲ့ ဘာကြောင့် AI တွေ၊ နည်းပညာစနစ်တွေဟာ မြန်မာလိုဆိုရင် အထစ်ထစ်အငေါ့ငေါ့ ဖြစ်နေရတာလဲ။ နည်းပညာလောကမှာ ဒါကို “Low-Resource Language” (ရင်းမြစ်နည်းပါးသော ဘာသာစကား) လို့ ခေါ်ကြပြီး ဒီအကြောင်းအရာဟာ ကျွန်ုပ်တို့ရဲ့ ဒစ်ဂျစ်တယ် အနာဂတ်အတွက် အလွန်အရေးပါတဲ့ ကိစ္စရပ်တစ်ခု ဖြစ်လာနေပါတယ်။
ရင်းမြစ်နည်းပါးသော ဘာသာစကား (Low-Resource Language) ဆိုတာ ဘာလဲ
ကွန်ပျူတာ သဘာဝဘာသာစကား စီမံခွဲခြမ်းစိတ်ဖြာမှု (Natural Language Processing - NLP) နဲ့ AI နယ်ပယ်မှာ ဘာသာစကားတစ်ခုကို “High-Resource” လား “Low-Resource” လားဆိုပြီး ခွဲခြားသတ်မှတ်တဲ့အခါ အဲဒီဘာသာစကားကို ပြောဆိုတဲ့ လူဦးရေ အရေအတွက်တစ်ခုတည်းကို ကြည့်ပြီး ဆုံးဖြတ်တာ မဟုတ်ပါဘူး။ အဓိက သတ်မှတ်ချက်ကတော့ ကွန်ပျူတာတွေ၊ AI မော်ဒယ်တွေ လေ့လာသင်ယူနိုင်ဖို့အတွက် လိုအပ်တဲ့ ဒစ်ဂျစ်တယ် အချက်အလက် (Digital Data/Resources) တွေ အင်တာနက်ပေါ်မှာ ဘယ်လောက်အထိ အဆင်သင့်ရှိနေသလဲ ဆိုတဲ့အချက် ဖြစ်ပါတယ်။
High-Resource Languages လို့ခေါ်တဲ့ အင်္ဂလိပ်၊ ပြင်သစ်၊ ဂျာမန်၊ တရုတ် စတဲ့ ဘာသာစကားတွေမှာဆိုရင် ဒစ်ဂျစ်တယ်စနစ်နဲ့ သေသေချာချာ သိမ်းဆည်းထားတဲ့ စာအုပ်စာစောင်တွေ၊ စွယ်စုံကျမ်းတွေ၊ သတင်းဆောင်းပါးတွေ၊ လူမှုကွန်ရက်ပေါ်က စာသားတွေနဲ့ အသံဖိုင်တွေ ဘီလီယံနဲ့ချီပြီး အသင့်ရှိနေပါတယ်။ ဒါတင်မကသေးဘဲ စာကြောင်းတစ်ခုချင်းစီကို အဓိပ္ပာယ်သတ်မှတ်ထားတဲ့ Labelled Data တွေ၊ အဘိဓာန်တွေနဲ့ သဒ္ဒါစည်းမျဉ်းဆိုင်ရာ ဒေတာဘေ့စ်တွေ အမြောက်အမြား ရှိနှင့်ပြီးသားပါ။
တစ်ဖက်မှာတော့ Low-Resource Languages တွေဟာ ဒီလို ဒစ်ဂျစ်တယ် အချက်အလက် ကြွယ်ဝမှု မရှိကြပါဘူး။ စာပေသမိုင်းကြောင်း ဘယ်လောက်ပဲ ရှည်လျားပြီး ပြောဆိုသူ ဘယ်လောက်ပဲ များပြားပါစေ ကွန်ပျူတာ ဖတ်ရှုနားလည်နိုင်တဲ့ ပုံစံနဲ့ သိမ်းဆည်းထားတဲ့ ဒေတာမလုံလောက်ရင်၊ ဘာသာပြန်ဖို့အတွက် စာကြောင်းအပြိုင်တွဲထားတဲ့ Parallel Corpora တွေ မရှိရင်၊ ဒါမှမဟုတ် စနစ်တကျ ပြုစုထားတဲ့ Text & Speech Dataset တွေ ရှားပါးနေရင် အဲဒီဘာသာစကားကို ရင်းမြစ်နည်းပါးသော ဘာသာစကားအဖြစ် သတ်မှတ်လိုက်ကြရပါတယ်။
ဒါဆိုရင် မြန်မာဘာသာစကားဟာ ဘာကြောင့် ဒီအုပ်စုထဲ ရောက်နေရတာလဲ
မြန်မာဘာသာစကားဟာ လူဦးရေ သန်းဆယ်ချီ ပြောဆိုကြပြီး ကြွယ်ဝတဲ့ စာပေအမွေအနှစ် ရှိတဲ့ ဘာသာစကားတစ်ခု ဖြစ်ပေမဲ့ နည်းပညာပိုင်းဆိုင်ရာမှာတော့ သေချာပေါက် Low-Resource Language အုပ်စုထဲမှာပဲ ရှိနေပါသေးတယ်။ ဒီလိုဖြစ်ရတဲ့ အကြောင်းရင်းတွေကတော့ ရှုပ်ထွေးပြီး သမိုင်းကြောင်းဆိုင်ရာရော၊ နည်းပညာဆိုင်ရာ အခက်အခဲတွေပါ ရောယှက်နေပါတယ်။
ပထမဆုံးနဲ့ အထင်ရှားဆုံး အကြောင်းရင်းကတော့ ကျွန်ုပ်တို့ ဖြတ်သန်းခဲ့ရတဲ့ “ဖောင့်ပြဿနာ” (Font Fragmentation) ရဲ့ အကျိုးဆက်ပါပဲ။ နှစ်ပေါင်းများစွာကြာအောင် နိုင်ငံတကာ စံနှုန်းမညီတဲ့ ဇော်ဂျီဖောင့်ကို တွင်တွင်ကျယ်ကျယ် အသုံးပြုခဲ့ကြတဲ့အတွက် အင်တာနက်ပေါ်မှာ ရှိနေတဲ့ မြန်မာစာ အချက်အလက် အများအပြားဟာ စံမညီတဲ့ Encoding တွေနဲ့ ရောထွေးနေခဲ့ပါတယ်။ ယူနီကုဒ် (Unicode) ကို အသွင်ကူးပြောင်းခဲ့ကြပေမဲ့လည်း အရင်က ရေးသားခဲ့တဲ့ ဒစ်ဂျစ်တယ် မှတ်တမ်းများစွာဟာ အမှိုက်ဒေတာ (Noisy Data) တွေ ဖြစ်ကုန်ပြီး AI မော်ဒယ်တွေ လေ့ကျင့်ဖို့အတွက် တိုက်ရိုက်ယူသုံးဖို့ ခက်ခဲသွားစေခဲ့ပါတယ်။
ဒုတိယအချက်ကတော့ စနစ်တကျ သန့်စင်ထားတဲ့ Data အရင်းအမြစ် နည်းပါးမှု ဖြစ်ပါတယ်။ မြန်မာလို ရေးထားတဲ့ ဝဘ်ဆိုဒ်တွေ၊ သတင်းမီဒီယာတွေ၊ ဝီကီပီးဒီးယား ဆောင်းပါးတွေ ရှိပေမဲ့ ကမ္ဘာ့အဆင့်မီ ဘာသာစကားတွေနဲ့ ယှဉ်လိုက်ရင် ပမာဏအားဖြင့် အလွန်ကို အလှမ်းကွာနေပါသေးတယ်။ အထူးသဖြင့် ဆေးပညာ၊ ဥပဒေ၊ နည်းပညာ စတဲ့ နယ်ပယ်အလိုက် သီးသန့် အချက်အလက်တွေ (Domain-specific Datasets) ဟာ ဒစ်ဂျစ်တယ်စနစ်မှာ အလွန်ရှားပါးပါတယ်။ စာအုပ်အဟောင်းတွေနဲ့ စာပေလက်ရာ အများအပြားဟာလည်း စာရွက်ပေါ်မှာပဲ ကျန်နေသေးပြီး ကွန်ပျူတာဖတ်နိုင်တဲ့ Text အဖြစ် ပြောင်းလဲနိုင်ခြင်း မရှိသေးပါဘူး။
တတိယအချက်ကတော့ မြန်မာစာရဲ့ သဘာဝဘာသာစကားဆိုင်ရာ ရှုပ်ထွေးမှု (Linguistic Complexity) ပါပဲ။ မြန်မာစာဟာ အင်္ဂလိပ်စာလို စကားလုံးတစ်လုံးနဲ့ တစ်လုံးကြား ပုံမှန် ပုဒ်ဖြတ် ပုဒ်ရပ် (Spaces) ချရေးတဲ့ စနစ် မဟုတ်ပါဘူး။ ဒါကြောင့် ကွန်ပျူတာတစ်လုံးက စာကြောင်းတစ်ကြောင်းကို ဖတ်တဲ့အခါ ဘယ်နေရာမှာ စကားလုံးပြတ်တယ်ဆိုတာကို ခွဲခြားရတဲ့ Word Segmentation / Tokenization အဆင့်ကတည်းက စိန်ခေါ်မှု အကြီးအကျယ် ကြုံရပါတယ်။ ဒါ့အပြင် စာစကား နဲ့ အပြောစကား အသုံးအနှုန်း အလွန်ကွာခြားတာ၊ သဒ္ဒါဖွဲ့စည်းပုံ ရှုပ်ထွေးတာနဲ့ အသံတူ စာလုံးကွဲတွေ များပြားတာတွေကလည်း AI မော်ဒယ်တွေအတွက် မြန်မာစာကို တိတိကျကျ နားလည်ဖို့ ပိုမိုခက်ခဲစေပါတယ်။
ဒစ်ဂျစ်တယ်ကမ္ဘာထဲက ကွာဟချက်နဲ့ ဘာကြောင့် ဒါကို အရေးစိုက်သင့်သလဲ
ဘာသာစကားတစ်ခုဟာ နည်းပညာနယ်ပယ်မှာ ရင်းမြစ်နည်းပါးတဲ့ အခြေအနေမှာပဲ ဆက်ရှိနေမယ်ဆိုရင် အဲဒီဘာသာစကားကို ပြောဆိုသူတွေဟာ “ဒစ်ဂျစ်တယ် သုဉ်းဝပ်မှု” (Digital Divide) ကို ခံစားကြရမှာ ဖြစ်ပါတယ်။
ယနေ့ခေတ်မှာ AI က ပညာရေး၊ ကျန်းမာရေး၊ စီးပွားရေးနဲ့ သုတေသနကဏ္ဍ အားလုံးကို မောင်းနှင်နေပါပြီ။ အင်္ဂလိပ်စကားပြော နိုင်ငံတွေမှာ ကျောင်းသားတွေ၊ လုပ်ငန်းရှင်တွေဟာ AI ကို သဘာဝကျကျ အသုံးချပြီး အလုပ်တွေကို အဆပေါင်းများစွာ ပိုမိုမြန်ဆန်အောင် လုပ်ဆောင်နေချိန်မှာ မြန်မာဘာသာစကားတစ်ခုတည်းကိုပဲ အသုံးပြုနိုင်တဲ့သူတွေဟာ ဒီနည်းပညာ အကျိုးကျေးဇူးတွေကို အပြည့်အဝ မခံစားရဘဲ နောက်ကျကျန်ရစ်ခဲ့နိုင်ပါတယ်။
ဒါ့အပြင် ဘာသာပြန်စနစ်တွေမှာ အမှားအယွင်းများတာ၊ အသံမှတ်သားမှု စနစ်တွေက မြန်မာအသံကို ကောင်းစွာ နားမလည်တာတွေဟာ သတင်းအချက်အလက် ရယူသုံးစွဲနိုင်မှုကို ကြီးမားတဲ့ အတားအဆီး ဖြစ်စေပါတယ်။ ပိုပြီးဆိုးရွားတာကတော့ နောင်အနာဂတ်မှာ နည်းပညာတွေ ပိုမိုတိုးတက်လာတဲ့အခါ ဒစ်ဂျစ်တယ်ကမ္ဘာထဲမှာ မြန်မာဘာသာစကားရဲ့ နေရာဟာ တဖြည်းဖြည်း ပျောက်ကွယ်သွားနိုင်တဲ့ အန္တရာယ်ပါပဲ။
ရှေ့ဆက် ဘာတွေလုပ်ဆောင်ကြမလဲ
ဒီစိန်ခေါ်မှုကို ကျော်လွှားဖို့ဆိုတာ နိုင်ငံတကာ နည်းပညာကုမ္ပဏီကြီးတွေရဲ့ အစီအစဉ်တစ်ခုတည်းကိုပဲ ထိုင်စောင့်နေလို့ မရနိုင်ပါဘူး။ ပြည်တွင်းက နည်းပညာသမားတွေ၊ ဘာသာဗေဒပညာရှင်တွေနဲ့ သုတေသီတွေ ပူးပေါင်းပြီး Open Data လှုပ်ရှားမှုတွေကို တိုးမြှင့်ဖန်တီးကြဖို့ လိုအပ်ပါတယ်။
သန့်စင်ပြီး စံနှုန်းမီတဲ့ မြန်မာစာ Corpus တွေ တည်ဆောက်တာ၊ ဘာသာစကားဆိုင်ရာ ဒေတာတွေကို Open-Source အဖြစ် လွတ်လပ်စွာ မျှဝေတာ၊ ကွဲပြားတဲ့ စကားပြောအသံ Dataset တွေကို စုဆောင်းတာနဲ့ ဘာသာဗေဒဆိုင်ရာ အရင်းအမြစ်တွေကို ဒစ်ဂျစ်တယ်အသွင် ပြောင်းလဲတာတွေကို အားတက်သရော လုပ်ဆောင်ကြရမှာ ဖြစ်ပါတယ်။
နည်းပညာတွေ ဘယ်လောက်ပဲ ကောင်းမွန်လာပါစေ၊ အဲဒီနည်းပညာကို ဖြည့်ဆည်းပေးမယ့် “အရင်းအမြစ်” မရှိရင် စက်တွေဟာ ကိုယ့်ရဲ့ ဘာသာစကားကို နားလည်လာမှာ မဟုတ်ပါဘူး။ မြန်မာဘာသာစကားကို Low-Resource ဘဝကနေ ရုန်းထွက်နိုင်စေဖို့၊ ဒစ်ဂျစ်တယ် အနာဂတ်မှာ ခေတ်မီစွာ ဆက်လက်ရှင်သန်နေစေဖို့အတွက် စနစ်ကျတဲ့ ဒေတာတွေ ဖန်တီးစုဆောင်းခြင်းဟာ ယနေ့ခေတ်မှာ မဖြစ်မနေ လုပ်ဆောင်ရမယ့် အမျိုးသားရေးဆိုင်ရာ နည်းပညာတာဝန်တစ်ခု ဖြစ်နေပါတော့တယ်။