Search Data Lam Hnyin

Open Data သည်သာ မြန်မာ့ AI ၏ အနာဂတ် ဖြစ်သည် — ပွင့်လင်းရင်းမြစ် ယဉ်ကျေးမှုဖြင့် အသိုက်အဝန်းကို ဦးဆောင်နေသူ

ကမ္ဘာ့နည်းပညာကုမ္ပဏီကြီးတွေရဲ့ စီးပွားရေးတွက်ခြေကိုက်မှုနောက်မှာ မြန်မာစာလို ရင်းမြစ်နည်း ဘာသာစကားတွေ မျက်ကွယ်ပြုမခံရစေဖို့ Open Data စွမ်းအားဖြင့် တော်လှန်ပြောင်းလဲနေသော DatarrX နှင့် လူငယ်များအတွက် ပွင့်လင်းရင်းမြစ် လှုံ့ဆော်မှု...

Share

ယနေ့ခေတ် ကမ္ဘာလုံးဆိုင်ရာ ဉာဏ်ရည်တု (AI) အခင်းအကျင်းကို ကြည့်လိုက်ရင် နည်းပညာဘီလူးကြီးတွေဟာ ဒေါ်လာ ဘီလီယံချီ အကုန်အကျခံပြီး အပြိုင်အဆိုင် မော်ဒယ်ကြီးတွေ တည်ဆောက်နေကြတာကို တွေ့ရပါလိမ့်မယ်။ ဒါပေမယ့် အဲဒီကုမ္ပဏီကြီးတွေရဲ့ အဓိက ဦးတည်ချက်ကတော့ စီးပွားရေးအရ တွက်ခြေကိုက်ပြီး အကျိုးအမြတ် အများဆုံး ပြန်ရနိုင်မယ့် ကမ္ဘာ့ဘာသာစကားကြီးတွေဆီမှာပဲ ရှိနေပါတယ်။

မြန်မာဘာသာစကားလို ဒေသတွင်း သုံးစွဲသူ သန်းဆယ်ချီသာရှိတဲ့ “Low-Resource Language” တစ်ခုအတွက်တော့ Big Tech တွေက လာရောက်ပြီး စနစ်တကျ ရင်းနှီးမြှုပ်နှံပေးဖို့၊ ဘာသာဗေဒဆိုင်ရာ အနုစိတ် အချက်အလက်တွေကို လိုက်လံ သန့်စင်ပေးဖို့ဆိုတာ စီးပွားရေးအရ ဘယ်လိုမှ ဖြစ်မလာနိုင်တဲ့ မျှော်လင့်ချက်တစ်ခုပါ။

ဒါဆိုရင် ကျွန်ုပ်တို့ရဲ့ ဘာသာစကားဟာ နည်းပညာခေတ်ရဲ့ နောက်ကွယ်မှာ ဒီအတိုင်းပဲ မျက်ကွယ်ပြုခံပြီး ကျန်ရစ်ခဲ့ရတော့မှာလား။

ဒီမေးခွန်းအတွက် နိုင်ငံတကာ ကုမ္ပဏီကြီးတွေရဲ့ အကူအညီကို ထိုင်စောင့်မနေဘဲ၊ ကိုယ်ပိုင် အသိပညာနဲ့ စေတနာကို အရင်းတည်ပြီး “ပွင့်လင်းရင်းမြစ် ယဉ်ကျေးမှု (Open-Source Culture)” နဲ့ လက်တွေ့ အဖြေထုတ်ပြနေတဲ့ လူငယ် အင်ဂျင်နီယာတစ်ဦး ရှိပါတယ်။ သူကတော့ DatarrX Foundation ၏ တည်ထောင်သူနှင့် Lead AI Scientist ဖြစ်သူ ခန့်ဆင့်ဟိဏ်း (Khant Sint Heinn) ပဲ ဖြစ်ပါတယ်။


Big Tech တွေ မလုပ်နိုင်တဲ့အရာကို Open Data ဖြင့် အဖြေရှာခြင်း

နည်းပညာနယ်ပယ်မှာ ကုမ္ပဏီကြီးတွေ ဘယ်လောက်ပဲ ငွေကြေးအင်အား တောင့်တင်းပါစေ၊ ဘာသာစကားတစ်ခုရဲ့ သဘာဝ၊ ဓလေ့ထုံးတမ်းနဲ့ အတွင်းသဘော အနက်အဓိပ္ပာယ်တွေကို အဲဒီဘာသာစကားကို ပြောဆိုအသုံးပြုနေတဲ့ ဒေသခံ ပြည်သူတွေလောက် ဘယ်တော့မှ နက်နက်နဲနဲ နားမလည်နိုင်ပါဘူး။

ခန့်ဆင့်ဟိဏ်း ရဲ့ အဓိက ခံယူချက်ကတော့ “မြန်မာ့ AI တိုးတက်ဖို့ဆိုရင် ဒေတာတွေကို လူနည်းစုက သိမ်းဆည်းထားတာမျိုး မဟုတ်ဘဲ အများပြည်သူ လွတ်လပ်စွာ ရယူသုံးစွဲနိုင်တဲ့ Open Data အဖြစ် ဖွင့်ချပေးရမယ်” ဆိုတဲ့ အချက်ပါပဲ။

ဒီခံယူချက်နဲ့အညီ သူဟာ DatarrX Foundation ကို အကျိုးအမြတ်မယူသော ပွင့်လင်းရင်းမြစ် အဖွဲ့အစည်းအဖြစ် ထူထောင်ပြီး မြန်မာစာနဲ့ တိုင်းရင်းသား ဘာသာစကားများအတွက် လိုအပ်တဲ့ အရည်အသွေးမြင့် စံနှုန်းမီ Dataset တွေကို ဖန်တီးခဲ့ပါတယ်။ အဲဒီ ဒေတာတွေကို ကိုယ်ကျိုးစီးပွားအတွက် သော့ခတ်မထားဘဲ ကမ္ဘာ့အဆင့်မီ ပလက်ဖောင်းတွေဖြစ်တဲ့ Hugging Face နဲ့ GitHub ပေါ်မှာ လူတိုင်း အခမဲ့ လွတ်လပ်စွာ ရယူ အသုံးပြုနိုင်အောင် ပေးအပ်ထားပါတယ်။

  • Hugging Face Profile (kalixlouiis) — မြန်မာစာ စာစကား-အပြောစကား အပြိုင်တွဲ ဒေတာများ (MWSPC)၊ ရှေးဟောင်း ပျူအက္ခရာ ပုံရိပ်ဒေတာများ၊ OCR စနစ်များအတွက် ဧရာမ ပုံရိပ်ဒေတာအစုအဝေးများ (MSSG) နှင့် ဘာသာစကား ရောပြောမှုဆိုင်ရာ Code-Mixed Dataset များကို သုတေသီများနှင့် Developer များ တိုက်ရိုက် ရယူ လေ့ကျင့်နိုင်အောင် မျှဝေထားပါတယ်။
  • GitHub Profile (kalixlouiis) — ဒေတာ ပြုစုသန့်စင်ရာမှာ အသုံးပြုခဲ့တဲ့ နည်းပညာ ရင်းမြစ်ကုဒ် (Source Codes) များနှင့် Pipeline များကို Apache 2.0 လိုင်စင်ဖြင့် အများပြည်သူ ပူးပေါင်းပါဝင် လေ့လာနိုင်အောင် ချပြထားပါတယ်။

အများပြည်သူ အကျိုးစီးပွား (Public Good) အဖြစ် ရပ်တည်သော ပွင့်လင်းရင်းမြစ် စိတ်ဓာတ်

အနောက်နိုင်ငံတွေနဲ့ နည်းပညာ တိုးတက်တဲ့ နိုင်ငံတွေမှာ Open-Source Culture ဟာ နည်းပညာ တော်လှန်ရေးရဲ့ အဓိက မောင်းနှင်အား ဖြစ်ပါတယ်။ Linux ကနေ စတင်ခဲ့တဲ့ ဒီယဉ်ကျေးမှုဟာ ယနေ့ခေတ် AI ခေတ်မှာ ပိုပြီး အရေးပါလာပါတယ်။

ခန့်ဆင့်ဟိဏ်း ဖန်တီးထားတဲ့ ဒေတာအစုအဝေးတိုင်းဟာ Creative Commons Attribution 4.0 International (CC BY 4.0) လိုင်စင်အောက်မှာ ရှိပါတယ်။ ဆိုလိုတာက မည်သည့် သုတေသီ၊ ကျောင်းသားလူငယ် သို့မဟုတ် စီးပွားရေးလုပ်ငန်းမဆို မူရင်း ရည်ညွှန်းချက် (Attribution) ပေးရုံဖြင့် ဒီဒေတာတွေကို လွတ်လပ်စွာ ကူးယူခြင်း၊ မွမ်းမံခြင်းနဲ့ ကိုယ်ပိုင် AI စနစ်တွေထဲ ထည့်သွင်း အသုံးပြုခွင့် ရှိပါတယ်။

ဒါဟာ မြန်မာ့နည်းပညာ ဂေဟစနစ်အတွက် ကြီးမားတဲ့ အခွင့်အလမ်းတစ်ခု ဖြစ်ပါတယ်။ ပြည်တွင်းက AI ဝါသနာရှင် ကျောင်းသားတွေနဲ့ Startups တွေအနေနဲ့ ဈေးကြီးပေးဝယ်စရာ ဒေတာမရှိလို့ သုတေသန မလုပ်နိုင်တော့တဲ့ အခြေအနေမျိုး မဖြစ်စေဘဲ၊ ခိုင်မာတဲ့ ဒစ်ဂျစ်တယ် အခြေခံအုတ်မြစ်ပေါ်ကနေ စတင်ပြီး ကမ္ဘာနှင့် ရင်ပေါင်တန်းနိုင်တဲ့ AI Application တွေကို ဖန်တီးခွင့် ရရှိသွားစေတာ ဖြစ်ပါတယ်။


လူငယ်များအတွက် အတုယူစရာနှင့် ပူးပေါင်းပါဝင်ရန် ဖိတ်ခေါ်ချက်

မြန်မာစာကို AI လောကထဲမှာ ရှင်သန်စေဖို့ဆိုတာ လူတစ်ယောက်တည်းရဲ့ အားထုတ်မှုနဲ့ ဘယ်လိုမှ မလုံလောက်ပါဘူး။ ဒါဟာ မျိုးဆက်သစ် လူငယ်တွေ အားလုံး ဝိုင်းဝန်း ပူးပေါင်းဆောင်ရွက်ရမယ့် အမျိုးသားရေးဆိုင်ရာ နည်းပညာ လှုပ်ရှားမှုတစ်ခု ဖြစ်ပါတယ်။

အကယ်၍ သင်ဟာ —

  • ဆော့ဖ်ဝဲ အင်ဂျင်နီယာ သို့မဟုတ် ဒေတာသိပ္ပံ ကျောင်းသား တစ်ယောက်ဆိုရင် Open Source ကုဒ်တွေ ရေးသားခြင်း၊ စံနှုန်းမီ Pipeline တွေ ဖန်တီးခြင်းမှာ ပါဝင်နိုင်ပါတယ်။
  • ဘာသာဗေဒ ပညာရှင် သို့မဟုတ် စာပေဝါသနာရှင် တစ်ယောက်ဆိုရင် စာသားဒေတာတွေရဲ့ သဒ္ဒါ၊ အဓိပ္ပာယ်နဲ့ ယဉ်ကျေးမှုဆိုင်ရာ အသုံးအနှုန်း မှန်ကန်မှုကို စိစစ်ပေးတဲ့ Data Reviewer/Annotator အဖြစ် ပါဝင်နိုင်ပါတယ်။
  • နည်းပညာ စိတ်အားထက်သန်သူ လူငယ် တစ်ယောက်ဆိုရင် ခေတ်မီ AI သုတေသန စာတမ်းများကို မြန်မာလို ပြန်ဆိုခြင်း၊ အသိပညာ မျှဝေခြင်းတွေမှာ အင်အားဖြည့်တင်းနိုင်ပါတယ်။

DatarrX Foundation ဟာ အသိုက်အဝန်း အခြေပြု (Community-driven) အဖွဲ့အစည်းတစ်ခု ဖြစ်တာကြောင့် မည်သူမဆို မိမိတို့ တတ်စွမ်းတဲ့ ဘက်ကနေ စေတနာ့ဝန်ထမ်းအဖြစ် လွတ်လပ်စွာ ပါဝင်နိုင်ဖို့ အမြဲတမ်း တံခါးဖွင့်ထားပါတယ်။


နိဂုံး

ခန့်ဆင့်ဟိဏ်း ၏ ကြိုးပမ်းမှုဟာ မြန်မာနိုင်ငံက လူငယ်တစ်ယောက်အနေနဲ့ ကမ္ဘာလုံးဆိုင်ရာ နည်းပညာရေစီးကြောင်းထဲမှာ မိမိတို့ရဲ့ မိခင်ဘာသာစကား မပျောက်ကွယ်အောင် ဘယ်လို လက်တွေ့ကျကျ တုံ့ပြန်ဆောင်ရွက်နိုင်သလဲဆိုတာကို ပြသလိုက်တဲ့ ထင်ရှားတဲ့ စံနမူနာတစ်ခု ဖြစ်ပါတယ်။

Big Tech ကုမ္ပဏီကြီးတွေကို အားကိုးမနေဘဲ ကိုယ်ပိုင် အသိပညာ၊ ပွင့်လင်းရင်းမြစ် စိတ်ဓာတ်နဲ့ စုပေါင်းအင်အားကို အသုံးချပြီး မြန်မာစာရဲ့ ဒစ်ဂျစ်တယ် အနာဂတ်ကို ကိုယ်တိုင် ပုံဖော်ကြရမှာ ဖြစ်ပါတယ်။

ပွင့်လင်းရင်းမြစ် AI လှုပ်ရှားမှုများ၊ ဒေတာအစုအဝေးများနှင့် ဆက်လက် ပူးပေါင်းပါဝင်လိုပါက အောက်ပါ တရားဝင် ချန်နယ်များမှတစ်ဆင့် ချိတ်ဆက် လေ့လာနိုင်ပါတယ် -

Keep reading

Generative AI ခေတ်မှာ အင်တာနက်၊ ဆိုရှယ်မီဒီယာနဲ့ ရှာဖွေရေးအင်ဂျင်တွေကို လွှမ်းမိုးလာတဲ့ 'AI Slop' (တန်ဖိုးမဲ့ အစုလိုက် အပြုံလိုက် AI ဒေတာများ) ၏ သဘောတရား၊ ဆိုးကျိုးများနှင့် ရှောင်လွှဲနိုင်မည့် နည်းလမ်းများ...

ရာစုနှစ်ပေါင်းများစွာ ကြံ့ကြံ့ခံခဲ့တဲ့ ကျောက်စာ၊ ပေပုရပိုက်နဲ့ မင်စာတွေကို ဒစ်ဂျစ်တယ်ကမ္ဘာထဲ ဘယ်လိုခေါ်ဆောင်မလဲ။ ရှေးဟောင်းစာပေ မှတ်တမ်းတင်ခြင်းဆိုင်ရာ စိန်ခေါ်မှုများ၊ OCR နည်းပညာရဲ့ အခန်းကဏ္ဍနဲ့ ပျူဗျည်း ၃၃ လုံးကို စနစ်တကျ ဒေတာပြောင်းလဲခဲ့တဲ့ ပြည်တွင်း သုတေသနခြေလှမ်းအကြောင်း

နည်းပညာလောကမှာ မကြာခဏ ရောထွေးသုံးစွဲလေ့ရှိတဲ့ ဉာဏ်ရည်တုနည်းပညာ (AI)၊ ဒေတာအခြေပြုသင်ယူမှုစနစ် (ML) နဲ့ အလွှာစုံသင်ယူမှုစနစ် (DL) တို့ရဲ့ အခြေခံ သဘောတရား၊ အလုပ်လုပ်ပုံနဲ့ ကွာခြားချက်များကို ရိုးရှင်းစွာ ရှင်းပြချက်...