'Data is Food for AI' — မြန်မာနိုင်ငံမှာ AI အတွက် သန့်စင်ပြီးသား အချက်အလက်တွေ ဘယ်မှာရှာမလဲ
ဉာဏ်ရည်တု (AI) တွေ ကျန်းမာထက်မြက်ဖို့ဆိုရင် အာဟာရပြည့်ဝတဲ့ ဒေတာတွေ လိုအပ်ပါတယ်။ မြန်မာ့ AI လောကရဲ့ ဒေတာငတ်မွတ်မှုပြဿနာ၊ အရင်းအမြစ်ရှာဖွေရခက်ခဲမှုနဲ့ ဒီကွက်လပ်ကို ဖြည့်ဆည်းပေးဖို့ ကြိုးပမ်းနေကြတဲ့ ပြည်တွင်း အားထုတ်မှုများအကြောင်း
ကွန်ပျူတာသိပ္ပံနဲ့ ဆော့ဖ်ဝဲလောကမှာ ခေတ်အဆက်ဆက် သတိပေးစကားတစ်ခုအဖြစ် ပြောလေ့ရှိတဲ့ စကားစုလေးတစ်ခု ရှိပါတယ်။ အဲဒါကတော့ “Garbage In, Garbage Out” (အမှိုက်ထည့်ရင် အမှိုက်ပဲ ပြန်ထွက်မယ်) ဆိုတဲ့ သဘောတရားပါပဲ။ ဒီစကားဟာ ယနေ့ခေတ် Artificial Intelligence (AI)၊ Deep Learning နဲ့ Machine Learning ခေတ်ကို ရောက်လာတဲ့အခါ ရိုးရိုးသတိပေးချက်အဆင့်ထက် ကျော်လွန်ပြီး နည်းပညာတစ်ခုလုံးရဲ့ အသက်သွေးကြော အမှန်တရား ဖြစ်လာပါတယ်။
AI စနစ်တွေ၊ အထူးသဖြင့် စကားပြောဆိုနိုင်တဲ့ Language Model တွေဟာ မွေးရာပါ ဉာဏ်ပညာရှင်တွေ မဟုတ်ကြပါဘူး။ သူတို့ရဲ့ အတွင်းပိုင်းဖွဲ့စည်းပုံဟာ လူသားတွေ ဖန်တီးထားတဲ့ သင်္ချာဆိုင်ရာ အယ်လ်ဂိုရီသမ်တွေသာ ဖြစ်ပြီး လူသားတွေ ကျွေးမွေးလိုက်တဲ့ စာသား၊ အသံနဲ့ ပုံရိပ် အချက်အလက် (Data) တွေကို ဖတ်ရှု၊ လေ့လာ၊ မှတ်သားပြီးမှသာ စဉ်းစားတွေးခေါ်နိုင်စွမ်းကို တည်ဆောက်ယူကြရတာ ဖြစ်ပါတယ်။ ဒါကြောင့်လည်း ကမ္ဘာ့ထိပ်တန်း AI သုတေသီတစ်ဦးဖြစ်သူ Andrew Ng က “Data is food for AI” လို့ အင်မတန် ထိမိတဲ့ ဥပမာတစ်ခုနဲ့ တင်စားခေါ်ဝေါ်ခဲ့တာပါ။
အာဟာရပြည့်ဝပြီး သန့်ရှင်းလတ်ဆတ်တဲ့ အစားအစာကို ပုံမှန် စားသုံးရတဲ့ ကလေးငယ်တစ်ယောက်ဟာ ဉာဏ်ရည်ထက်မြက်ပြီး ကျန်းမာသန်စွမ်းလာသလိုမျိုးပဲ၊ စနစ်တကျ ပြုစုသန့်စင်ထားတဲ့ Data တွေကို လေ့ကျင့်ခွင့်ရတဲ့ AI မော်ဒယ်တွေဟာလည်း အမှားအယွင်းကင်းပြီး ယုံကြည်စိတ်ချရတဲ့ ရလဒ်တွေကို ပေးစွမ်းနိုင်ပါတယ်။ ဆန့်ကျင်ဘက်အနေနဲ့ အဟာရချို့တဲ့ပြီး အမှိုက်တွေ၊ အဆိပ်အတောက်တွေ ရောပြွမ်းနေတဲ့ ဒေတာတွေကိုသာ စားသုံးခွင့်ရတဲ့ AI ဟာလည်း စကားပြောရင် လွဲချော်တာ၊ အဓိပ္ပာယ်မရှိတာတွေကို တောက်လျှောက် ဖော်ပြနေမှာ ဖြစ်ပါတယ်။
ဒီနေရာမှာ ကျွန်ုပ်တို့အားလုံး ရင်ဆိုင်နေရတဲ့ မေးခွန်းကြီးတစ်ခု ထွက်ပေါ်လာပါတယ်။ ကျွန်ုပ်တို့ရဲ့ မိခင်ဘာသာစကားဖြစ်တဲ့ မြန်မာစာနဲ့ ပတ်သက်လာရင် AI မော်ဒယ်တွေ ကျန်းမာစွာ ကြီးထွားဖို့အတွက် “သန့်စင်ပြီးသား အာဟာရဒေတာတွေ” မြန်မာနိုင်ငံမှာ ဘယ်လောက်အထိ အဆင်သင့် ရှိနေပြီလဲ။ ဘယ်နေရာတွေမှာ သွားရှာရမလဲ။
ဆာလောင်နေဆဲ မြန်မာ့ AI နှင့် အဆိပ်သင့် ဒေတာများ၏ အန္တရာယ်
ကမ္ဘာပေါ်မှာ အင်္ဂလိပ်၊ တရုတ်၊ စပိန် စတဲ့ ဘာသာစကားတွေအတွက်ဆိုရင် ဒစ်ဂျစ်တယ်စနစ်နဲ့ သေသေချာချာ သိမ်းဆည်းထားတဲ့ စာအုပ်စာစောင်တွေ၊ စွယ်စုံကျမ်းတွေ၊ သတင်းဆောင်းပါးတွေနဲ့ စနစ်တကျ ပြုစုထားတဲ့ Text & Audio Dataset တွေ ဘီလီယံနဲ့ချီပြီး အသင့်ရှိနေပါတယ်။ ဒါကြောင့် အဲဒီဘာသာစကားတွေနဲ့ မေးမြန်းတဲ့အခါ AI တွေဟာ အင်မတန် အထာကျကျ ပြန်လည်ဖြေဆိုနိုင်ကြတာပါ။
ဒါပေမယ့် မြန်မာဘာသာစကားနယ်ပယ်မှာတော့ အခြေအနေဟာ လုံးဝ ဆန့်ကျင်ဘက် ဖြစ်နေဆဲပါ။ မြန်မာစာဟာ ပျူခေတ်၊ ပုဂံခေတ်ကတည်းက အမြစ်တွယ်ခဲ့တဲ့ နှစ်ထောင်ချီ ရှည်လျားလှတဲ့ သမိုင်းနဲ့ စာပေအမွေအနှစ်တွေ ကြွယ်ဝစွာ ရှိနေပေမဲ့ ဒီအချက်အလက် အများစုဟာ စာအုပ်စာစောင်တွေနဲ့ ပေပုရပိုက်တွေပေါ်မှာပဲ ကျန်ရစ်နေပြီး ကွန်ပျူတာ နားလည်ဖတ်ရှုနိုင်တဲ့ ဒစ်ဂျစ်တယ်စနစ် (Machine-readable Format) ဆီကို မရောက်ရှိသေးပါဘူး။ နိုင်ငံတကာ နည်းပညာလောကမှာ ဒါကို “Low-Resource Language” (ရင်းမြစ်နည်းပါးသော ဘာသာစကား) လို့ သတ်မှတ်ထားကြပါတယ်။
ပိုဆိုးတာကတော့ အင်တာနက်ပေါ်မှာ လက်ရှိ ရှိနေတဲ့ မြန်မာစာ ဒေတာအများစုဟာ ဖောင့်စံနှုန်းမညီတဲ့ ပြဿနာ (Zawgyi နှင့် Unicode အရှုပ်အထွေး)၊ စာလုံးပေါင်း သတ်ပုံအမှားများပြားမှု၊ အကြောင်းအရာအရ အမုန်းစကား (Hate Speech) တွေ ရောထွေးနေမှုတွေကြောင့် “အဆိပ်သင့် ဒေတာ” (Noisy Data) တွေ အဖြစ် များစွာ တည်ရှိနေပါတယ်။
ဒီလို သန့်စင်မှုမရှိတဲ့ ဒေတာတွေကို AI ထဲ ထည့်သွင်းလိုက်တဲ့အခါ ဘာသာပြန်စနစ်တွေမှာ အဓိပ္ပာယ် ကမောက်ကမ ဖြစ်တာ၊ စကားလုံးအဓိပ္ပာယ် လွဲမှားတာနဲ့ မြန်မာ့ယဉ်ကျေးမှုဆိုင်ရာ အသုံးအနှုန်းတွေကို နားမလည်တဲ့ အခြေအနေတွေ ဖြစ်ပေါ်လာရပါတယ်။ ရလဒ်အနေနဲ့ မြန်မာနိုင်ငံသားတွေဟာ ကမ္ဘာ့အဆင့်မီ AI နည်းပညာရဲ့ အသီးအပွင့်တွေကို မိခင်ဘာသာစကားနဲ့ အပြည့်အဝ အသုံးမချနိုင်ဘဲ ဒစ်ဂျစ်တယ်ကွာဟချက် (Digital Divide) ကြောင့် ပညာရေး၊ ကျန်းမာရေးနဲ့ စီးပွားရေးနယ်ပယ်တွေမှာ နောက်ကျကျန်ရစ်မယ့် အန္တရာယ်နဲ့ ရင်ဆိုင်နေရပါတယ်။
မြန်မာနိုင်ငံမှာ AI အတွက် သန့်စင်ပြီးသား ဒေတာ ဘယ်မှာရှာမလဲ
ဒေတာသိပ္ပံပညာရှင်တွေ၊ AI Developer တွေ ဒါမှမဟုတ် သုတေသနလုပ်နေတဲ့ ကျောင်းသားလူငယ်တွေအနေနဲ့ မြန်မာဘာသာစကားဆိုင်ရာ AI Model တွေ (ဥပမာ - Chatbot များ၊ ဘာသာပြန်စနစ်များ၊ အသံမှတ်သားမှု စနစ်များ) ကို တည်ဆောက်ချင်တဲ့အခါ အကြီးမားဆုံး အဟန့်အတားက “အရည်အသွေးမီတဲ့ ဒေတာ ဘယ်ကယူရမလဲ” ဆိုတဲ့ ကိစ္စပါပဲ။
လက်ရှိမှာ မြန်မာစာ AI ဒေတာတွေကို ရှာဖွေနိုင်တဲ့ အဓိက လမ်းကြောင်းအချို့ ရှိပါတယ် -
ပထမဆုံးအနေနဲ့ ကမ္ဘာလုံးဆိုင်ရာ Open-Source AI Repository တွေဖြစ်တဲ့ Hugging Face နဲ့ Kaggle တို့လို ပလက်ဖောင်းတွေမှာ ဖြစ်ပါတယ်။ နိုင်ငံတကာ သုတေသီတွေနဲ့ ပြည်တွင်းက နည်းပညာရှင်တချို့ မျှဝေထားတဲ့ Multilingual Datasets တွေထဲမှာ မြန်မာဘာသာစကား အစိတ်အပိုင်းတချို့ကို ရှာတွေ့နိုင်ပါတယ်။ သို့သော်လည်း အဆိုပါ ဒေတာအများစုဟာ ပမာဏ နည်းပါးလွန်းတာ၊ သို့မဟုတ် အင်္ဂလိပ်စာကနေ စက်ဘာသာပြန် (Machine Translated) စနစ်နဲ့ အကြမ်းပြန်ထားတာတွေ ဖြစ်နေတတ်တဲ့အတွက် အရည်အသွေးပိုင်းမှာ စိန်ခေါ်မှုတွေ ရှိနေဆဲ ဖြစ်ပါတယ်။
ဒုတိယနည်းလမ်းကတော့ အများပြည်သူပိုင် သတင်းဝဘ်ဆိုဒ်တွေ၊ ဝီကီပီးဒီးယား (Wikipedia) မြန်မာစာမျက်နှာတွေကနေ Web Scraping နည်းနဲ့ ကိုယ်တိုင် ဒေတာကောက်ယူတာ ဖြစ်ပါတယ်။ ဒါပေမယ့် ဒီနည်းလမ်းဟာ စာလုံးပေါင်းသတ်ပုံ အမှားတွေ၊ ဖောင့်မညီတာတွေနဲ့ HTML အမှိုက်တွေကို သန့်စင်ဖို့အတွက် အချိန်နဲ့ လုပ်အား အဆမတန် ပေးဆပ်ရလေ့ ရှိပါတယ်။
ဒီလို အခြေအနေတွေကြောင့် ပြည်တွင်းမှာ စနစ်တကျ သုတေသနပြုထားတဲ့၊ စံနှုန်းမီပြီး သန့်စင်ထားတဲ့ Dataset တွေကို စုစည်းဖန်တီးပြီး လူတိုင်း အခမဲ့ အသုံးပြုနိုင်အောင် မျှဝေပေးမယ့် အခြေခံအဆောက်အအုံတစ်ခု မဖြစ်မနေ လိုအပ်လာခဲ့ပါတယ်။
ကွက်လပ်ကို ဖြည့်ဆည်းပေးဖို့ ကြိုးပမ်းလာသော ပြည်တွင်း အားထုတ်မှုများနှင့် DatarrX
ဒီလို မြန်မာစာ NLP နယ်ပယ်ရဲ့ ကြီးမားတဲ့ လိုအပ်ချက်နဲ့ ကွက်လပ်ကို ဖြည့်ဆည်းပေးဖို့အတွက် ရှေ့တန်းကနေ တစ်ဖက်တစ်လမ်းက တက်ကြွစွာ ဝင်ရောက်ကူညီပေးနေတဲ့ အဖွဲ့အစည်းတစ်ခုကတော့ DatarrX (ဒေတာ-အက်စ်) ပဲ ဖြစ်ပါတယ်။
DatarrX ဆိုတာ မြန်မာဘာသာစကားဆိုင်ရာ Natural Language Processing (NLP) နည်းပညာ တိုးတက်ပြန့်ပွားစေဖို့အတွက် အကျိုးအမြတ်မယူဘဲ ရပ်တည်နေတဲ့ ပွင့်လင်းရင်းမြစ် ဖောင်ဒေးရှင်း (Non-profit, Non-governmental, and Open-source Foundation) တစ်ခု ဖြစ်ပါတယ်။ အဖွဲ့အစည်းရဲ့ အမည်နာမနောက်ကွယ်မှာ “Defining the Unknown through Rigorous Data Research” (စနစ်ကျနသော ဒေတာသုတေသနနည်းလမ်းများဖြင့် အဖြေမရှိသေးသည့် စိန်ခေါ်မှုများကို ဖြေရှင်းခြင်း) ဆိုတဲ့ နည်းပညာဆိုင်ရာ ခံယူချက် အပြည့်အဝ ပါဝင်နေပါတယ်။
တည်ထောင်သူ ခန့်ဆင့်ဟိဏ်း (Khant Sint Heinn) က အဖွဲ့အစည်း စတင်ပေါ်ပေါက်လာပုံနဲ့ ပတ်သက်ပြီး အခုလို ရှင်းပြထားပါတယ် -
“ကျွန်တော်တို့ DatarrX ကို စတင်တည်ထောင်ရခြင်း ရည်ရွယ်ချက်ကတော့ ရှင်းပါတယ်။ ယနေ့ခေတ် ဉာဏ်ရည်တု (AI) နည်းပညာတွေကို မြန်မာနိုင်ငံသားတိုင်း မိမိတို့ရဲ့ မိခင်ဘာသာစကားနဲ့ တန်းတူညီမျှ အသုံးပြုနိုင်စေဖို့ ဖြစ်ပါတယ်။ လက်ရှိမှာ နည်းပညာတွေ ဘယ်လောက်ပဲ တိုးတက်နေပါစေ၊ မြန်မာစာနဲ့ တိုင်းရင်းသား ဘာသာစကားတွေအတွက် အရည်အသွေးမီ ဒေတာအရင်းအမြစ်တွေ မရှိသေးတဲ့အတွက် လူတိုင်း နည်းပညာကို ထိရောက်စွာ အသုံးမချနိုင်ကြသေးပါဘူး။ ဒီကွက်လပ်ကို ဖြည့်ဆည်းဖို့ ဒေတာတွေကို စနစ်တကျ ပြုစုပြီး အများပြည်သူအတွက် ပွင့်လင်းရင်းမြစ် (Open-source) အဖြစ် အခမဲ့ မျှဝေပေးသွားမှာ ဖြစ်ပါတယ်။”
DatarrX ဟာ ဒေတာတွေကို အင်တာနက်ပေါ်ကနေ ရမ်းသန်း ကူးယူစုဆောင်းတာမျိုး မဟုတ်ဘဲ နည်းပညာပိုင်းဆိုင်ရာ စံနှုန်းများနှင့်အညီ စနစ်တကျ အဆင့်ဆင့် သန့်စင်စိစစ်ပါတယ် -
- စနစ်တကျ စုဆောင်းခြင်း (Collection): စာသား (Text) ဒေတာများအပြင် AI မှ စကားပြောစနစ်တွေကို လေ့ကျင့်နိုင်မယ့် အသံဖိုင်နှင့် စာသားမှတ်တမ်း (Audio & Transcription) များကိုပါ စုဆောင်းပါတယ်။
- နည်းပညာသုံး သန့်စင်ခြင်း (Cleaning & Formatting): စာလုံးပေါင်းအမှားများ၊ ဖောင့်မညီညွတ်မှုများနှင့် မလိုအပ်သော သင်္ကေတများကို နည်းပညာသုံး ဖယ်ရှားကာ AI မော်ဒယ်တွေ တိုက်ရိုက်ဖတ်နိုင်တဲ့ စံနှုန်းမီ JSON, CSV, Parquet Format တွေအဖြစ် ပြောင်းလဲပါတယ်။
- အရည်အသွေး နှစ်ဆင့်စစ်ဆေးခြင်း (Quality Assurance): ဘာသာစကားဆိုင်ရာ ကျွမ်းကျင်သူများနှင့် နည်းပညာအဖွဲ့ဝင်များ ပူးပေါင်းပြီး အမှားအယွင်း ကင်းစင်စေရန် စိစစ်အတည်ပြုပါတယ်။
- ပွင့်လင်းရင်းမြစ်အဖြစ် ဖြန့်ဝေခြင်း (Open-source Release): စစ်ဆေးပြီးသား ဒေတာတွေကို Hugging Face, GitHub, Kaggle စတဲ့ ကမ္ဘာ့ပလက်ဖောင်းတွေအပြင် datarrx.org ကနေတစ်ဆင့် အများပြည်သူ လွတ်လပ်စွာ အသုံးပြုနိုင်တဲ့ Creative Commons (CC BY 4.0) နဲ့ Apache 2.0 လိုင်စင်တွေနဲ့ အခမဲ့ ချပြပေးထားပါတယ်။
ဒါ့အပြင် လာမည့် ၅ နှစ်တာ ကာလအတွင်း မြန်မာဘာသာစကားသာမက ရင်းမြစ်ရှားပါးနေတဲ့ တိုင်းရင်းသားဘာသာစကားများအတွက်ပါ ရည်ရွယ်ပြီး စာသားအကျဉ်းချုပ်ခြင်း (Summarization)၊ အမေးအဖြေစနစ် (Q&A)၊ ဘာသာပြန်ဆိုခြင်း (Translation) စတဲ့ နယ်ပယ်စုံ Text Dataset အခု ၅၀ ထက်မနည်းကို ဖန်တီးဖြန့်ဝေသွားဖို့ ရည်မှန်းထားတာ တွေ့ရပါတယ်။
ဘာသာစကားတစ်ခုရဲ့ ဒစ်ဂျစ်တယ် အနာဂတ်ကို စုပေါင်းပုံဖော်ခြင်း
AI ဆိုတာ အနာဂတ်ရဲ့ အဓိက မောင်းနှင်အား ဖြစ်လာနေပါပြီ။ သို့သော်လည်း အဲဒီ AI တွေ သန်မာလာဖို့ ကျွေးမွေးရမယ့် “ဒေတာ အာဟာရ” တွေ ပြည့်စုံသန့်ရှင်းနေမှသာ ကျွန်ုပ်တို့ရဲ့ မြန်မာစကား၊ မြန်မာစာဟာ ဒစ်ဂျစ်တယ် ကမ္ဘာထဲမှာ ဘေးဖယ်မခံရဘဲ ဆက်လက် ရှင်သန်နိုင်မှာ ဖြစ်ပါတယ်။
ဒါဟာ အဖွဲ့အစည်းတစ်ခုတည်း ဒါမှမဟုတ် လူတစ်စုတည်းရဲ့ အားထုတ်မှုနဲ့ ပြီးမြောက်နိုင်တဲ့ ကိစ္စမဟုတ်ပါဘူး။ နည်းပညာရှင်တွေ၊ ဘာသာဗေဒ ပညာရှင်တွေ၊ ဆော့ဖ်ဝဲ အင်ဂျင်နီယာတွေနဲ့ ကျောင်းသားလူငယ်တွေ အားလုံးက ဒေတာစုဆောင်းခြင်း၊ သန့်စင်စစ်ဆေးခြင်း၊ နည်းပညာစာတမ်းများ ဘာသာပြန်ဆိုခြင်း စတဲ့ ကဏ္ဍတွေမှာ ကိုယ်စီ တတ်စွမ်းသမျှ ပါဝင်ကူညီကြဖို့ လိုအပ်ပါတယ်။
အကယ်၍ သင်ဟာ မြန်မာ့ AI ဖွံ့ဖြိုးတိုးတက်ရေးအတွက် သန့်စင်ပြီးသား ဒေတာတွေကို ရှာဖွေနေတယ်ဆိုရင်ဖြစ်စေ၊ မိမိတတ်စွမ်းတဲ့ ဘာသာစကားနဲ့ နည်းပညာ အသိပညာတွေနဲ့ စေတနာ့ဝန်ထမ်းအဖြစ် ဝိုင်းဝန်း ပံ့ပိုးပေးချင်တယ်ဆိုရင်ဖြစ်စေ DatarrX တရားဝင် ဝဘ်ဆိုဒ် (datarrx.org) ကနေတစ်ဆင့် ချိတ်ဆက်ပါဝင်ပြီး ကျွန်ုပ်တို့ရဲ့ မြန်မာဘာသာစကားကို ခေတ်မီ AI လောကထဲမှာ အတူတကွ အမြစ်တွယ် ရှင်သန်စေကြဖို့ ဖိတ်ခေါ်လိုက်ရပါတယ်။