ခေတ်သစ် AI လောကထဲက မြန်မာစာ အုတ်မြစ်တည်ဆောက်သူ — NLP Engineer & Data Foundation Specialist ခန့်ဆင့်ဟိဏ်း
မြန်မာစကားကို Low-Resource Language ဘဝကနေ ရုန်းထွက်နိုင်စေဖို့ Data-Centric AI နည်းလမ်းများဖြင့် စနစ်တကျ အခြေခံအုတ်မြစ် တည်ဆောက်နေသူ DatarrX Foundation ၏ တည်ထောင်သူ လူငယ်အင်ဂျင်နီယာ ခန့်ဆင့်ဟိဏ်း၏ ကြိုးပမ်းချက်များနှင့် သုတေသနခြေလှမ်းများ...
ကမ္ဘာတစ်ဝန်းမှာ Artificial Intelligence (AI) နည်းပညာတွေ နေ့ချင်းညချင်း တိုးတက်လာပြီး လူသားတွေရဲ့ လူမှုစီးပွား၊ ပညာရေးနဲ့ နေ့စဉ်ဘဝတွေကို ပြောင်းလဲမောင်းနှင်နေပါတယ်။ ဒါပေမယ့် ဒီနည်းပညာ တော်လှန်ရေးကြီးရဲ့ နောက်ကွယ်မှာ မြန်မာဘာသာစကားနဲ့ တိုင်းရင်းသား ဘာသာစကားတွေဟာ ကွန်ပျူတာ နားလည်နိုင်တဲ့ အရည်အသွေးမြင့် စံနှုန်းမီ ဒေတာ မလုံလောက်မှုကြောင့် “Low-Resource Languages” (ရင်းမြစ်နည်းပါးသော ဘာသာစကားများ) အဖြစ် ဘေးဖယ်ခံထားရဆဲ ဖြစ်ပါတယ်။
ဒီဒစ်ဂျစ်တယ် ကွာဟချက် (Digital Divide) ကြီးကို မျက်ကွယ်မပြုဘဲ၊ မြန်မာစကားကို ကမ္ဘာ့အဆင့်မီ AI မော်ဒယ်တွေထဲမှာ ခိုင်မာစွာ အမြစ်တွယ်နိုင်စေဖို့ ရှေ့တန်းကနေ တက်ကြွစွာ ခြေလှမ်းစတင်နေတဲ့ မြန်မာလူငယ် အင်ဂျင်နီယာတစ်ဦး ရှိပါတယ်။ သူကတော့ Machine Learning Engineer, NLP & Data Foundation Specialist တစ်ဦးဖြစ်ပြီး DatarrX Foundation ၏ တည်ထောင်သူနှင့် Lead AI Scientist ဖြစ်သူ ခန့်ဆင့်ဟိဏ်း (Khant Sint Heinn) ပဲ ဖြစ်ပါတယ်။
ပြဿနာကို မြင်တွေ့ခြင်းမှသည် DatarrX တည်ထောင်ခြင်းဆီသို့
မြန်မာဘာသာစကားဟာ ပျူနဲ့ ပုဂံခေတ်ကတည်းက စတင်ခဲ့တဲ့ နှစ်ထောင်ချီ ကြွယ်ဝတဲ့ စာပေသမိုင်း ရှိပေမဲ့ AI ခေတ်သစ်မှာတော့ အကြီးအကျယ် ရုန်းကန်နေရပါတယ်။ အတိတ်ကာလ ဖောင့်စံနှုန်း မညီညွတ်ခဲ့မှုများ၊ စနစ်တကျ သန့်စင်ထားတဲ့ ဒေတာမရှိမှုများနဲ့ ရှိပြီးသား ဒေတာအများစုကလည်း အများပြည်သူ လွတ်လပ်စွာ သုံးစွဲနိုင်တဲ့ ပွင့်လင်းရင်းမြစ် (Open-source) အဖြစ် မတည်ရှိခဲ့တာတွေကြောင့် မြန်မာစာဟာ နည်းပညာအရ ကမ္ဘာ့အဆင့် AI မော်ဒယ်တွေမှာ လွဲချော်မှုတွေ၊ အဓိပ္ပာယ်ကောက် မှားယွင်းမှုတွေနဲ့ ကြုံတွေ့နေရပါတယ်။
ဒီအခြေအနေကို လက်ပိုက်ကြည့်မနေဘဲ ၂၀၂၅ ခုနှစ်၊ ဒီဇင်ဘာလ ၁၂ ရက်နေ့မှာ ခန့်ဆင့်ဟိဏ်း ဟာ DatarrX (ဒေတာ-အက်စ်) ကို အကျိုးအမြတ်မယူသော ပွင့်လင်းရင်းမြစ် ဖောင်ဒေးရှင်း (Non-profit Open-source Foundation) တစ်ခုအဖြစ် စတင်တည်ထောင်ခဲ့ပါတယ်။
အဖွဲ့အစည်းရဲ့ အမည်ဖြစ်တဲ့ DatarrX နောက်ကွယ်မှာ “Defining the Unknown through Rigorous Data Research” ဆိုတဲ့ မူဝါဒ ရှိပြီး သူ တည်ထောင်ရတဲ့ ရည်ရွယ်ချက်နဲ့ ပတ်သက်လို့ အခုလို ပြတ်သားစွာ ခံယူထားပါတယ် -
“ကျွန်တော်တို့ DatarrX ကို စတင်တည်ထောင်ရခြင်း ရည်ရွယ်ချက်ကတော့ ရှင်းပါတယ်။ ယနေ့ခေတ် ဉာဏ်ရည်တု (AI) နည်းပညာတွေကို မြန်မာနိုင်ငံသားတိုင်း မိမိတို့ရဲ့ မိခင်ဘာသာစကားနဲ့ တန်းတူညီမျှ အသုံးပြုနိုင်စေဖို့ ဖြစ်ပါတယ်။ လက်ရှိမှာ နည်းပညာတွေ ဘယ်လောက်ပဲ တိုးတက်နေပါစေ၊ မြန်မာစာနဲ့ တိုင်းရင်းသား ဘာသာစကားတွေအတွက် အရည်အသွေးမီ ဒေတာအရင်းအမြစ်တွေ မရှိသေးတဲ့အတွက် လူတိုင်း နည်းပညာကို ထိရောက်စွာ အသုံးမချနိုင်ကြသေးပါဘူး။ ဒီကွက်လပ်ကို ဖြည့်ဆည်းဖို့ ဒေတာတွေကို စနစ်တကျ ပြုစုပြီး အများပြည်သူအတွက် ပွင့်လင်းရင်းမြစ် (Open-source) အဖြစ် အခမဲ့ မျှဝေပေးသွားမှာ ဖြစ်ပါတယ်။”
Data-Centric AI ဖြင့် မြန်မာစာ၏ နည်းပညာ ကွက်လပ်များကို ဖြည့်ဆည်းခြင်း
ခန့်ဆင့်ဟိဏ်း ဟာ Model တွေကို အဆမတန် ကြီးမားအောင် လုပ်ခြင်းထက် Model ထဲ ထည့်သွင်းမယ့် ဒေတာအရည်အသွေးကို သိပ္ပံနည်းကျ စိစစ်မြှင့်တင်တဲ့ Data-Centric AI ချဉ်းကပ်မှုကို အဓိက လက်ကိုင်ထားပါတယ်။
သူဟာ မြန်မာစာ NLP နယ်ပယ်မှာ နှစ်ပေါင်းများစွာ ကြုံတွေ့နေရတဲ့ လက်တွေ့ ပြဿနာတွေကို အောက်ပါ အဓိက သုတေသနနဲ့ ပရောဂျက်တွေကတစ်ဆင့် လက်တွေ့ကျကျ ဖြေရှင်းပေးနေပါတယ် -
၁။ myX-Tokenizer (မြန်မာစာ အပိုင်းပိုင်းပြတ်ခြင်းကို ဖြေရှင်းခြင်း)
မြန်မာစာကို LLM တွေနဲ့ ချိတ်ဆက်တဲ့အခါ စကားလုံးတွေ အစိတ်စိတ်အမြွာမြွာ ကွဲထွက်သွားတတ်တဲ့ Over-fragmentation ပြဿနာဟာ အကြီးမားဆုံး အဟန့်အတား ဖြစ်ပါတယ်။ ခန့်ဆင့်ဟိဏ်း ဟာ 128k Vocabulary ပါဝင်တဲ့ Unigram Algorithm အခြေခံ myX-Tokenizer ကို တည်ဆောက်ပြီး ခေတ်သစ် LLMs တွေနဲ့ Embedding Models တွေမှာ မြန်မာစာကို ထိရောက်စွာ နားလည်နိုင်အောင် ဖန်တီးပေးခဲ့ပါတယ်။
၂။ Myanmar Written-Spoken Parallel Corpus - MWSPC (စာစကားနှင့် အပြောစကား ကွာဟချက်)
မြန်မာစကားမှာ စာရေးသားပုံနဲ့ နေ့စဉ် အပြောစကား အလွန်ကွာခြားပါတယ်။ MWSPC ဟာ သီးခြား စာကြောင်းအပြိုင်တွဲ ၅,၅၅၅ တွဲ ပါဝင်တဲ့ အရည်အသွေးမြင့် Dataset ဖြစ်ပြီး AI က သဘာဝကျတဲ့ အပြောစကား စတိုင်ပြောင်းလဲမှု (Style Transfer) လုပ်ဆောင်နိုင်ဖို့ မရှိမဖြစ် အရေးပါတဲ့ အခြေခံအရင်းအမြစ် ဖြစ်ပါတယ်။
၃။ Myanmar Synthetic Syllable Glyphs - MSSG (OCR စနစ်များအတွက် ကြီးမားသော ပုံရိပ်ဒေတာ)
မြန်မာစာ စာလုံးပေါင်းစပ်ပုံတွေကို ကွန်ပျူတာ မျက်စိက တိတိကျကျ မှတ်မိစေဖို့အတွက် ပုံသဏ္ဌာန် အမျိုးမျိုး ချဲ့ထွင်ဖန်တီးထားတဲ့ Glyph Images ပေါင်း ၁၄ သန်းကျော် (14M+) ပါဝင်တဲ့ ဧရာမ ပုံရိပ်ဒေတာအစုအဝေးကြီးကို ဖန်တီးထုတ်ဝေခဲ့ပါတယ်။
၄။ Burmese-English Code-Mixed Corpus (ဘာသာစကား ရောပြောမှု နားလည်စေခြင်း)
လူမှုကွန်ရက်နဲ့ နေ့စဉ်ဘဝမှာ မြန်မာစာနဲ့ အင်္ဂလိပ်စာ ရောနှောသုံးစွဲကြတဲ့ Code-Mixed ပုံစံတွေကို AI မော်ဒယ်တွေ တိကျစွာ ခွဲခြမ်းစိတ်ဖြာနိုင်စေဖို့ စနစ်တကျ Benchmark ပြုလုပ်ထားတဲ့ ဒေတာအစုအဝေး ဖြစ်ပါတယ်။
သမိုင်းအမွေအနှစ်ကို AI ဖြင့် ကယ်တင်ခြင်း — ပျူဗျည်း ၃၃ လုံး သုတေသန
သူ့ရဲ့ ထူးခြားပြောင်မြောက်တဲ့ သုတေသနတစ်ခုကတော့ ရှေးဟောင်း ပျူအက္ခရာတွေကို AI နည်းပညာနဲ့ စနစ်တကျ မှတ်တမ်းတင်ခဲ့တဲ့ သုတေသနစာတမ်း ဖြစ်ပါတယ်။
သီရိပျံချီ ဦးသာမြတ်ရဲ့ သမိုင်းဝင်ကျမ်းကိုး စံနှုန်းတွေကို အခြေခံပြီး ပျူဗျည်း ၃၃ လုံးအတွက် မူရင်းလက်ရေးနှင့် ပုံတူပွားပုံရိပ် စုစုပေါင်း ၅,၇၇၅ ပုံ ပါဝင်တဲ့ Dataset ကို ပထမဆုံးအကြိမ် စနစ်တကျ တည်ဆောက်ခဲ့ကာ “Preserving Myanmar’s Ancient Heritage: A Novel Dataset and ResNet Architecture for Pyu Character Recognition” (Research Square, DOI: 10.21203/rs.3.rs-10427861/v1) ဆိုတဲ့ ခေါင်းစဉ်နဲ့ တရားဝင် တင်ပြခဲ့ပါတယ်။ ဒါဟာ ဒစ်ဂျစ်တယ် လူမှုသိပ္ပံ (Digital Humanities) နဲ့ ရှေးဟောင်းစာပေ ထိန်းသိမ်းရေးအတွက် အဖိုးတန်တဲ့ ခြေလှမ်းသစ်တစ်ခု ဖြစ်ပါတယ်။
လူထုအခြေပြု Open-Source အသိုက်အဝန်း တည်ဆောက်ခြင်း
ခန့်ဆင့်ဟိဏ်း ရဲ့ အကြီးမားဆုံး ခံယူချက်တစ်ခုကတော့ “AI နည်းပညာနဲ့ ဒေတာတွေဟာ လူနည်းစုရဲ့ လက်ဝါးကြီးအုပ်မှု မဟုတ်ဘဲ အများပြည်သူဆိုင်ရာ အကျိုးစီးပွား (Public Good) ဖြစ်ရမယ်” ဆိုတဲ့ အချက်ပါပဲ။
သူ ဖန်တီးထားတဲ့ ဒေတာအစုအဝေးတွေ၊ ကုဒ်တွေနဲ့ ကိရိယာအားလုံးကို ကမ္ဘာလုံးဆိုင်ရာ ပလက်ဖောင်းတွေဖြစ်တဲ့ Hugging Face နဲ့ GitHub ပေါ်မှာ Creative Commons (CC BY 4.0) နဲ့ Apache 2.0 လိုင်စင်တွေနဲ့ အခမဲ့ ဖွင့်ချပေးထားပါတယ်။ အသိုက်အဝန်းအတွင်းရှိ သုတေသီတွေ၊ Developer တွေနဲ့ ကျောင်းသားလူငယ်တွေ အနေနဲ့ အခက်အခဲမရှိ ရယူအသုံးချနိုင်သလို၊ မိမိတို့ ကိုယ်တိုင်လည်း စေတနာ့ဝန်ထမ်းအဖြစ် ဝင်ရောက်ပူးပေါင်းနိုင်ဖို့ လမ်းဖွင့်ပေးထားပါတယ်။
နိဂုံးနှင့် ချိတ်ဆက်နိုင်မည့် လိပ်စာများ
မြန်မာဘာသာစကားကို AI ခေတ်သစ်ရဲ့ အလယ်မှာ ဂုဏ်သိက္ခာရှိစွာ ရှင်သန်ခိုင်မာစေဖို့အတွက် ခန့်ဆင့်ဟိဏ်း လို လူငယ် နည်းပညာရှင်တွေရဲ့ စနစ်ကျနတဲ့ ဒေတာအခြေပြု ကြိုးပမ်းမှုတွေဟာ မရှိမဖြစ် အရေးပါတဲ့ အခြေခံ အုတ်မြစ်တွေ ဖြစ်ပါတယ်။
သူ့ရဲ့ သုတေသနလုပ်ငန်းစဉ်များ၊ ပရောဂျက်များနှင့် ပွင့်လင်းရင်းမြစ် လှုပ်ရှားမှုများကို အောက်ပါ တရားဝင် ချန်နယ်များမှတစ်ဆင့် ဆက်သွယ်လေ့လာနိုင်ပါတယ် -
- ကိုယ်ပိုင် ပရိုဖိုင်နှင့် ဝဘ်ဆိုဒ် — khant-sint-heinn.datarrx.org
- DatarrX Foundation — datarrx.org
- Hugging Face (Datasets & Models) — huggingface.co/kalixlouiis
- GitHub (Source Codes) — github.com/kalixlouiis
- LinkedIn — linkedin.com/in/khant-sint-heinn
- ORCiD — 0009-0004-9209-1540