Open Data သည်သာ မြန်မာ့ AI ၏ အနာဂတ် ဖြစ်သည် — ပွင့်လင်းရင်းမြစ် ယဉ်ကျေးမှုဖြင့် အသိုက်အဝန်းကို ဦးဆောင်နေသူ
ကမ္ဘာ့နည်းပညာကုမ္ပဏီကြီးတွေရဲ့ စီးပွားရေးတွက်ခြေကိုက်မှုနောက်မှာ မြန်မာစာလို ရင်းမြစ်နည်း ဘာသာစကားတွေ မျက်ကွယ်ပြုမခံရစေဖို့ Open Data စွမ်းအားဖြင့် တော်လှန်ပြောင်းလဲနေသော DatarrX နှင့် လူငယ်များအတွက် ပွင့်လင်းရင်းမြစ် လှုံ့ဆော်မှု...
ယနေ့ခေတ် ကမ္ဘာလုံးဆိုင်ရာ ဉာဏ်ရည်တု (AI) အခင်းအကျင်းကို ကြည့်လိုက်ရင် နည်းပညာဘီလူးကြီးတွေဟာ ဒေါ်လာ ဘီလီယံချီ အကုန်အကျခံပြီး အပြိုင်အဆိုင် မော်ဒယ်ကြီးတွေ တည်ဆောက်နေကြတာကို တွေ့ရပါလိမ့်မယ်။ ဒါပေမယ့် အဲဒီကုမ္ပဏီကြီးတွေရဲ့ အဓိက ဦးတည်ချက်ကတော့ စီးပွားရေးအရ တွက်ခြေကိုက်ပြီး အကျိုးအမြတ် အများဆုံး ပြန်ရနိုင်မယ့် ကမ္ဘာ့ဘာသာစကားကြီးတွေဆီမှာပဲ ရှိနေပါတယ်။
မြန်မာဘာသာစကားလို ဒေသတွင်း သုံးစွဲသူ သန်းဆယ်ချီသာရှိတဲ့ “Low-Resource Language” တစ်ခုအတွက်တော့ Big Tech တွေက လာရောက်ပြီး စနစ်တကျ ရင်းနှီးမြှုပ်နှံပေးဖို့၊ ဘာသာဗေဒဆိုင်ရာ အနုစိတ် အချက်အလက်တွေကို လိုက်လံ သန့်စင်ပေးဖို့ဆိုတာ စီးပွားရေးအရ ဘယ်လိုမှ ဖြစ်မလာနိုင်တဲ့ မျှော်လင့်ချက်တစ်ခုပါ။
ဒါဆိုရင် ကျွန်ုပ်တို့ရဲ့ ဘာသာစကားဟာ နည်းပညာခေတ်ရဲ့ နောက်ကွယ်မှာ ဒီအတိုင်းပဲ မျက်ကွယ်ပြုခံပြီး ကျန်ရစ်ခဲ့ရတော့မှာလား။
ဒီမေးခွန်းအတွက် နိုင်ငံတကာ ကုမ္ပဏီကြီးတွေရဲ့ အကူအညီကို ထိုင်စောင့်မနေဘဲ၊ ကိုယ်ပိုင် အသိပညာနဲ့ စေတနာကို အရင်းတည်ပြီး “ပွင့်လင်းရင်းမြစ် ယဉ်ကျေးမှု (Open-Source Culture)” နဲ့ လက်တွေ့ အဖြေထုတ်ပြနေတဲ့ လူငယ် အင်ဂျင်နီယာတစ်ဦး ရှိပါတယ်။ သူကတော့ DatarrX Foundation ၏ တည်ထောင်သူနှင့် Lead AI Scientist ဖြစ်သူ ခန့်ဆင့်ဟိဏ်း (Khant Sint Heinn) ပဲ ဖြစ်ပါတယ်။
Big Tech တွေ မလုပ်နိုင်တဲ့အရာကို Open Data ဖြင့် အဖြေရှာခြင်း
နည်းပညာနယ်ပယ်မှာ ကုမ္ပဏီကြီးတွေ ဘယ်လောက်ပဲ ငွေကြေးအင်အား တောင့်တင်းပါစေ၊ ဘာသာစကားတစ်ခုရဲ့ သဘာဝ၊ ဓလေ့ထုံးတမ်းနဲ့ အတွင်းသဘော အနက်အဓိပ္ပာယ်တွေကို အဲဒီဘာသာစကားကို ပြောဆိုအသုံးပြုနေတဲ့ ဒေသခံ ပြည်သူတွေလောက် ဘယ်တော့မှ နက်နက်နဲနဲ နားမလည်နိုင်ပါဘူး။
ခန့်ဆင့်ဟိဏ်း ရဲ့ အဓိက ခံယူချက်ကတော့ “မြန်မာ့ AI တိုးတက်ဖို့ဆိုရင် ဒေတာတွေကို လူနည်းစုက သိမ်းဆည်းထားတာမျိုး မဟုတ်ဘဲ အများပြည်သူ လွတ်လပ်စွာ ရယူသုံးစွဲနိုင်တဲ့ Open Data အဖြစ် ဖွင့်ချပေးရမယ်” ဆိုတဲ့ အချက်ပါပဲ။
ဒီခံယူချက်နဲ့အညီ သူဟာ DatarrX Foundation ကို အကျိုးအမြတ်မယူသော ပွင့်လင်းရင်းမြစ် အဖွဲ့အစည်းအဖြစ် ထူထောင်ပြီး မြန်မာစာနဲ့ တိုင်းရင်းသား ဘာသာစကားများအတွက် လိုအပ်တဲ့ အရည်အသွေးမြင့် စံနှုန်းမီ Dataset တွေကို ဖန်တီးခဲ့ပါတယ်။ အဲဒီ ဒေတာတွေကို ကိုယ်ကျိုးစီးပွားအတွက် သော့ခတ်မထားဘဲ ကမ္ဘာ့အဆင့်မီ ပလက်ဖောင်းတွေဖြစ်တဲ့ Hugging Face နဲ့ GitHub ပေါ်မှာ လူတိုင်း အခမဲ့ လွတ်လပ်စွာ ရယူ အသုံးပြုနိုင်အောင် ပေးအပ်ထားပါတယ်။
- Hugging Face Profile (kalixlouiis) — မြန်မာစာ စာစကား-အပြောစကား အပြိုင်တွဲ ဒေတာများ (MWSPC)၊ ရှေးဟောင်း ပျူအက္ခရာ ပုံရိပ်ဒေတာများ၊ OCR စနစ်များအတွက် ဧရာမ ပုံရိပ်ဒေတာအစုအဝေးများ (MSSG) နှင့် ဘာသာစကား ရောပြောမှုဆိုင်ရာ Code-Mixed Dataset များကို သုတေသီများနှင့် Developer များ တိုက်ရိုက် ရယူ လေ့ကျင့်နိုင်အောင် မျှဝေထားပါတယ်။
- GitHub Profile (kalixlouiis) — ဒေတာ ပြုစုသန့်စင်ရာမှာ အသုံးပြုခဲ့တဲ့ နည်းပညာ ရင်းမြစ်ကုဒ် (Source Codes) များနှင့် Pipeline များကို Apache 2.0 လိုင်စင်ဖြင့် အများပြည်သူ ပူးပေါင်းပါဝင် လေ့လာနိုင်အောင် ချပြထားပါတယ်။
အများပြည်သူ အကျိုးစီးပွား (Public Good) အဖြစ် ရပ်တည်သော ပွင့်လင်းရင်းမြစ် စိတ်ဓာတ်
အနောက်နိုင်ငံတွေနဲ့ နည်းပညာ တိုးတက်တဲ့ နိုင်ငံတွေမှာ Open-Source Culture ဟာ နည်းပညာ တော်လှန်ရေးရဲ့ အဓိက မောင်းနှင်အား ဖြစ်ပါတယ်။ Linux ကနေ စတင်ခဲ့တဲ့ ဒီယဉ်ကျေးမှုဟာ ယနေ့ခေတ် AI ခေတ်မှာ ပိုပြီး အရေးပါလာပါတယ်။
ခန့်ဆင့်ဟိဏ်း ဖန်တီးထားတဲ့ ဒေတာအစုအဝေးတိုင်းဟာ Creative Commons Attribution 4.0 International (CC BY 4.0) လိုင်စင်အောက်မှာ ရှိပါတယ်။ ဆိုလိုတာက မည်သည့် သုတေသီ၊ ကျောင်းသားလူငယ် သို့မဟုတ် စီးပွားရေးလုပ်ငန်းမဆို မူရင်း ရည်ညွှန်းချက် (Attribution) ပေးရုံဖြင့် ဒီဒေတာတွေကို လွတ်လပ်စွာ ကူးယူခြင်း၊ မွမ်းမံခြင်းနဲ့ ကိုယ်ပိုင် AI စနစ်တွေထဲ ထည့်သွင်း အသုံးပြုခွင့် ရှိပါတယ်။
ဒါဟာ မြန်မာ့နည်းပညာ ဂေဟစနစ်အတွက် ကြီးမားတဲ့ အခွင့်အလမ်းတစ်ခု ဖြစ်ပါတယ်။ ပြည်တွင်းက AI ဝါသနာရှင် ကျောင်းသားတွေနဲ့ Startups တွေအနေနဲ့ ဈေးကြီးပေးဝယ်စရာ ဒေတာမရှိလို့ သုတေသန မလုပ်နိုင်တော့တဲ့ အခြေအနေမျိုး မဖြစ်စေဘဲ၊ ခိုင်မာတဲ့ ဒစ်ဂျစ်တယ် အခြေခံအုတ်မြစ်ပေါ်ကနေ စတင်ပြီး ကမ္ဘာနှင့် ရင်ပေါင်တန်းနိုင်တဲ့ AI Application တွေကို ဖန်တီးခွင့် ရရှိသွားစေတာ ဖြစ်ပါတယ်။
လူငယ်များအတွက် အတုယူစရာနှင့် ပူးပေါင်းပါဝင်ရန် ဖိတ်ခေါ်ချက်
မြန်မာစာကို AI လောကထဲမှာ ရှင်သန်စေဖို့ဆိုတာ လူတစ်ယောက်တည်းရဲ့ အားထုတ်မှုနဲ့ ဘယ်လိုမှ မလုံလောက်ပါဘူး။ ဒါဟာ မျိုးဆက်သစ် လူငယ်တွေ အားလုံး ဝိုင်းဝန်း ပူးပေါင်းဆောင်ရွက်ရမယ့် အမျိုးသားရေးဆိုင်ရာ နည်းပညာ လှုပ်ရှားမှုတစ်ခု ဖြစ်ပါတယ်။
အကယ်၍ သင်ဟာ —
- ဆော့ဖ်ဝဲ အင်ဂျင်နီယာ သို့မဟုတ် ဒေတာသိပ္ပံ ကျောင်းသား တစ်ယောက်ဆိုရင် Open Source ကုဒ်တွေ ရေးသားခြင်း၊ စံနှုန်းမီ Pipeline တွေ ဖန်တီးခြင်းမှာ ပါဝင်နိုင်ပါတယ်။
- ဘာသာဗေဒ ပညာရှင် သို့မဟုတ် စာပေဝါသနာရှင် တစ်ယောက်ဆိုရင် စာသားဒေတာတွေရဲ့ သဒ္ဒါ၊ အဓိပ္ပာယ်နဲ့ ယဉ်ကျေးမှုဆိုင်ရာ အသုံးအနှုန်း မှန်ကန်မှုကို စိစစ်ပေးတဲ့ Data Reviewer/Annotator အဖြစ် ပါဝင်နိုင်ပါတယ်။
- နည်းပညာ စိတ်အားထက်သန်သူ လူငယ် တစ်ယောက်ဆိုရင် ခေတ်မီ AI သုတေသန စာတမ်းများကို မြန်မာလို ပြန်ဆိုခြင်း၊ အသိပညာ မျှဝေခြင်းတွေမှာ အင်အားဖြည့်တင်းနိုင်ပါတယ်။
DatarrX Foundation ဟာ အသိုက်အဝန်း အခြေပြု (Community-driven) အဖွဲ့အစည်းတစ်ခု ဖြစ်တာကြောင့် မည်သူမဆို မိမိတို့ တတ်စွမ်းတဲ့ ဘက်ကနေ စေတနာ့ဝန်ထမ်းအဖြစ် လွတ်လပ်စွာ ပါဝင်နိုင်ဖို့ အမြဲတမ်း တံခါးဖွင့်ထားပါတယ်။
နိဂုံး
ခန့်ဆင့်ဟိဏ်း ၏ ကြိုးပမ်းမှုဟာ မြန်မာနိုင်ငံက လူငယ်တစ်ယောက်အနေနဲ့ ကမ္ဘာလုံးဆိုင်ရာ နည်းပညာရေစီးကြောင်းထဲမှာ မိမိတို့ရဲ့ မိခင်ဘာသာစကား မပျောက်ကွယ်အောင် ဘယ်လို လက်တွေ့ကျကျ တုံ့ပြန်ဆောင်ရွက်နိုင်သလဲဆိုတာကို ပြသလိုက်တဲ့ ထင်ရှားတဲ့ စံနမူနာတစ်ခု ဖြစ်ပါတယ်။
Big Tech ကုမ္ပဏီကြီးတွေကို အားကိုးမနေဘဲ ကိုယ်ပိုင် အသိပညာ၊ ပွင့်လင်းရင်းမြစ် စိတ်ဓာတ်နဲ့ စုပေါင်းအင်အားကို အသုံးချပြီး မြန်မာစာရဲ့ ဒစ်ဂျစ်တယ် အနာဂတ်ကို ကိုယ်တိုင် ပုံဖော်ကြရမှာ ဖြစ်ပါတယ်။
ပွင့်လင်းရင်းမြစ် AI လှုပ်ရှားမှုများ၊ ဒေတာအစုအဝေးများနှင့် ဆက်လက် ပူးပေါင်းပါဝင်လိုပါက အောက်ပါ တရားဝင် ချန်နယ်များမှတစ်ဆင့် ချိတ်ဆက် လေ့လာနိုင်ပါတယ် -
- DatarrX တရားဝင် ဝဘ်ဆိုဒ် — datarrx.org
- ခန့်ဆင့်ဟိဏ်း ပရိုဖိုင် — khant-sint-heinn.datarrx.org
- Hugging Face — huggingface.co/kalixlouiis
- GitHub — github.com/kalixlouiis
- LinkedIn — linkedin.com/in/khant-sint-heinn
- ORCiD — 0009-0004-9209-1540