Wikipedia မြန်မာစာမျက်နှာ နည်းပါးမှုက မြန်မာ AI အနာဂတ်အပေါ် ဘယ်လို ရိုက်ခတ်နေသလဲ
ကမ္ဘာကျော် Large Language Models (LLM) တွေ မြန်မာလို ပြောနိုင်ဖို့ အဓိက အားကိုးခဲ့ရတဲ့ ဝီကီပီးဒီးယား စာမျက်နှာ ရှားပါးမှု၊ အဲဒီကတစ်ဆင့် ဖြစ်ပေါ်လာတဲ့ AI အသိဉာဏ် ကွက်လပ်များနှင့် ကျွန်ုပ်တို့ ကိုယ်တိုင် ဘာတွေ လုပ်ဆောင်နိုင်မလဲ
ChatGPT၊ Claude ဒါမှမဟုတ် Gemini လို ကမ္ဘာကျော် AI မော်ဒယ်ကြီးတွေကို မြန်မာလို စာရိုက်ပြီး စကားသွားပြောဖူးကြပါလိမ့်မယ်။ တစ်ခါတလေကျရင် သူတို့က မြန်မာစကားကို တော်တော်လေး သဘာဝကျကျ ပြန်ဖြေနိုင်ပေမဲ့၊ မြန်မာ့သမိုင်း၊ ရိုးရာယဉ်ကျေးမှု၊ နာမည်ကြီး စာပေလက်ရာတွေ ဒါမှမဟုတ် သိပ္ပံဆိုင်ရာ အသုံးအနှုန်းတွေကို မြန်မာလို နက်နက်နဲနဲ မေးကြည့်လိုက်တဲ့အခါ မဆီမဆိုင်တွေ လျှောက်ဖြေတာ၊ အချက်အလက် အမှားတွေကို အမှန်လုပ်ပြီး ပြောတာ (Hallucination) တွေကို ကြုံဖူးကြမှာပါ။
ဒီလို ဘာကြောင့် ဖြစ်ရတာလဲ။ အဖြေကတော့ အင်မတန် ရိုးရှင်းပါတယ်။ AI ဟာ အခြေခံကျတဲ့ “အသိပညာဗဟုသုတ (Knowledge Base)” ကို မြန်မာဘာသာနဲ့ လုံလုံလောက်လောက် မသင်ယူခဲ့ရလို့ပါပဲ။
ဒီနေရာမှာ လူတော်တော်များများ သတိမထားမိတဲ့ အမှန်တရားတစ်ခု ရှိပါတယ်။ အဲဒါကတော့ လက်ရှိ ကမ္ဘာပေါ်မှာ ရှိသမျှ Large Language Models (LLMs) အားလုံးနီးပါး မြန်မာလို စကားပြောတတ်အောင် သင်ယူခဲ့ရတဲ့ အဓိက စာသား အရင်းအမြစ်ဟာ မြန်မာဝီကီပီးဒီးယား (Burmese Wikipedia) ဖြစ်နေတယ် ဆိုတဲ့ အချက်ပါပဲ။
LLM တွေအတွက် Wikipedia ဆိုတာ ဘာလဲ
AI သုတေသီတွေက Large Language Model တစ်ခုကို အင်တာနက်ပေါ်က ဒေတာတွေနဲ့ လေ့ကျင့် (Pre-train) ပေးတဲ့အခါ Social Media ပေါ်က စာသားတွေထက် Wikipedia လို အွန်လိုင်း စွယ်စုံကျမ်းတွေကို အဓိက “ရွှေရောင်ဒေတာ (High-Quality Data)” အဖြစ် သတ်မှတ်ကြပါတယ်။
အကြောင်းကတော့ Wikipedia ဟာ စာလုံးပေါင်းသတ်ပုံ အမှားနည်းတယ်၊ သဒ္ဒါဖွဲ့စည်းပုံ ကျစ်လျစ်တယ်၊ အမုန်းစကားတွေ မပါဝင်သလောက် နည်းပါးပြီး သမိုင်း၊ ပထဝီ၊ သိပ္ပံ၊ အနုပညာ စတဲ့ နယ်ပယ်စုံ အသိပညာတွေကို စနစ်တကျ မှတ်တမ်းတင်ထားလို့ ဖြစ်ပါတယ်။ ဒါကြောင့် AI မော်ဒယ်တစ်ခုကို ဘာသာစကားအသစ်တစ်ခု သင်ပေးချင်ပြီဆိုရင် သုတေသီတွေ အရင်ဆုံး ဒေါင်းလုဒ်ဆွဲယူပြီး ကျွေးမွေးလေ့ရှိတာဟာ အဲဒီဘာသာစကားရဲ့ Wikipedia Dump ဖိုင်တွေပါပဲ။
လက်တွေ့ ကိန်းဂဏန်းများနှင့် မြန်မာဝီကီပီးဒီးယား၏ အခြေအနေ
ဒါဆိုရင် မြန်မာဝီကီပီးဒီးယားမှာ အချက်အလက် ဘယ်လောက်အထိ ရှိနေပြီလဲ။
လူဦးရေ သန်း ၅၀ ကျော်ရှိပြီး မြန်မာစကားပြောသူ သန်း ၃၀ ကျော်ရှိတဲ့ ကျွန်ုပ်တို့နိုင်ငံမှာ လက်ရှိ မြန်မာဝီကီပီးဒီးယား စာမျက်နှာ စုစုပေါင်းဟာ ၁ သိန်း ၁ သောင်း (၁၁၀,၀၀၀ ကျော်) ဝန်းကျင်သာ ရှိပါသေးတယ်။ ဒီပမာဏဟာ အခြားသော အိမ်နီးချင်းနိုင်ငံတွေ၊ ဒါမှမဟုတ် လူဦးရေ နည်းပါးတဲ့ ဥရောပ ဘာသာစကားတွေနဲ့ ယှဉ်လိုက်ရင် အဆမတန် နည်းပါးလွန်းတဲ့ ပမာဏ ဖြစ်ပါတယ်။
ပိုပြီး ဆိုးရွားတာကတော့ ရှိပြီးသား ဆောင်းပါး ၁ သိန်းကျော်ထဲမှာလည်း စာကြောင်း နှစ်ကြောင်း၊ သုံးကြောင်းလောက်သာ ပါဝင်တဲ့ “ဆောင်းပါးတို (Stub Articles)” တွေက အများစု ဖြစ်နေတာပါပဲ။ နက်နဲတဲ့ သုတေသနဆောင်းပါးတွေ၊ ခေတ်သစ် နည်းပညာ၊ ဆေးပညာ၊ ဥပဒေနဲ့ ဒဿနိကဗေဒဆိုင်ရာ အကြောင်းအရာတွေဟာ မြန်မာလို အပြည့်အစုံ မရှိသလောက် ရှားပါးနေဆဲ ဖြစ်ပါတယ်။
ဒီရှားပါးမှုက မြန်မာ့ AI အနာဂတ်အပေါ် ဘယ်လို ရိုက်ခတ်နေသလဲ
Wikipedia စာမျက်နှာ နည်းပါးတာဟာ သာမန်အားဖြင့် အွန်လိုင်းမှာ စာဖတ်စရာ ရှားတာသက်သက်လို့ ထင်စရာ ရှိပေမဲ့၊ AI ခေတ်မှာတော့ အောက်ပါ ဆိုးကျိုးတွေကို တိုက်ရိုက် ဖြစ်ပေါ်စေပါတယ် -
၁။ AI မော်ဒယ်များ၏ မြန်မာစာ အသိဉာဏ် ခေါင်းပါးခြင်း — AI က မြန်မာစကားလုံး အထားအသိုကို တတ်ပေမဲ့ အတွင်းထဲမှာ အကြောင်းအရာဆိုင်ရာ အသိပညာ (Factual Knowledge) ဗလာနတ္ထိ ဖြစ်နေပါတယ်။ ဥပမာ - မြန်မာ့သမိုင်းက အရေးကြီးတဲ့ အဖြစ်အပျက်တစ်ခုကို မေးလိုက်ရင် အချက်အလက် မရှိတဲ့အတွက် စိတ်ကူးယဉ်ပြီး လျှောက်ပြောတာမျိုးတွေ ဖြစ်လာပါတယ်။
၂။ အင်္ဂလိပ်စာအပေါ် အလွန်အမင်း မှီခိုနေရခြင်း — LLM တွေဟာ မြန်မာစာနဲ့ ပတ်သက်တဲ့ ဗဟုသုတ မလုံလောက်တဲ့အခါ အင်္ဂလိပ်စာနဲ့ ရေးထားတဲ့ အချက်အလက်တွေကို စက်ဘာသာပြန် (Machine Translation) သုံးပြီး မြန်မာလို ပြန်လှည့်ဖြေဆိုရပါတယ်။ ဒါကြောင့် အသုံးအနှုန်းတွေဟာ သဘာဝမကျဘဲ စက်ရုပ်ဆန်ဆန် ဖြစ်နေရတာပါ။
၃။ ဒစ်ဂျစ်တယ် ကွာဟချက် ပိုမို ကြီးမားလာခြင်း — အင်္ဂလိပ်စာ တတ်ကျွမ်းသူတွေက AI ကို သုံးပြီး အဆင့်မြင့် သုတေသနတွေ၊ စီးပွားရေးလုပ်ငန်းတွေကို အဆမတန် မြန်ဆန်စွာ လုပ်ဆောင်နေချိန်မှာ မြန်မာစာ တစ်ခုတည်းကိုသာ အသုံးပြုနိုင်တဲ့ ပြည်သူတွေဟာ တိကျမှန်ကန်တဲ့ AI အထောက်အကူကို မရရှိဘဲ နောက်ကျကျန်ရစ်နေစေပါတယ်။
ကျွန်ုပ်တို့ ကိုယ်တိုင် ဘာတွေ လုပ်ဆောင်နိုင်မလဲ
ဒီပြဿနာကို ဖြေရှင်းဖို့ဆိုတာ နိုင်ငံတကာ ကုမ္ပဏီကြီးတွေ လာရောက် ဖြည့်ဆည်းပေးမှာကို စောင့်နေလို့ မရပါဘူး။ အဖြေက ကျွန်ုပ်တို့ လူထုတစ်ရပ်လုံးရဲ့ လက်ထဲမှာပဲ ရှိပါတယ်။
အဲဒါကတော့ မြန်မာဝီကီပီးဒီးယား (my.wikipedia.org) မှာ ကိုယ်တိုင် ကိုယ်ကျ ဝင်ရောက် ရေးသား ပံ့ပိုးပေးခြင်း (Contributing) ပါပဲ။
ဒါဟာ နည်းပညာ ကျွမ်းကျင်သူတွေမှ လုပ်လို့ရတဲ့ အလုပ် မဟုတ်ပါဘူး။ စာရေးဝါသနာပါသူ၊ ဘာသာပြန် ဝါသနာပါသူ၊ ကျောင်းသားလူငယ် ဒါမှမဟုတ် မိမိ ဝါသနာပါရာ နယ်ပယ်တစ်ခုခု (ဥပမာ - ရုပ်ရှင်၊ သမိုင်း၊ ရုက္ခဗေဒ၊ အားကစား၊ နည်းပညာ) မှာ အသိပညာ ရှိသူ မည်သူမဆို လုပ်ဆောင်နိုင်ပါတယ်။
- တစ်ပတ်ကို ဆောင်းပါးတစ်ပုဒ်လောက် အင်္ဂလိပ်ဝီကီပီးဒီးယားကနေ မြန်မာလို စနစ်တကျ ဘာသာပြန်ပေးတာမျိုး၊
- ရှိပြီးသား စာမျက်နှာတိုလေးတွေကို စာကြောင်းရေ ထပ်မံဖြည့်စွက်ပြီး အချက်အလက် ပြည့်စုံအောင် ပြုပြင်ပေးတာမျိုး၊
- စာလုံးပေါင်း သတ်ပုံအမှားတွေကို ဝင်ရောက် တည်းဖြတ်ပေးတာမျိုး စတဲ့ သေးငယ်တဲ့ လုပ်ဆောင်ချက်တိုင်းဟာ တန်ဖိုးမဖြတ်နိုင်ပါဘူး။
သင် ဒီနေ့ မြန်မာဝီကီပီးဒီးယားမှာ စနစ်တကျ ရေးသားလိုက်တဲ့ ဆောင်းပါးတစ်ပုဒ်၊ ဝါကျတစ်ကြောင်းချင်းစီဟာ နောင်တစ်ချိန်မှာ မြန်မာစကားပြော AI တွေ လေ့လာသင်ယူရမယ့် တန်ဖိုးရှိတဲ့ “အသိပညာ အာဟာရ” တွေ ဖြစ်သွားမှာပါ။
နိဂုံး
မြန်မာဘာသာစကားဟာ ဒစ်ဂျစ်တယ်ကမ္ဘာမှာ ဆက်လက် ရှင်သန်နိုင်မလား၊ ဒါမှမဟုတ် တိမ်ကော ပျောက်ကွယ်သွားမလားဆိုတာ အင်တာနက်ပေါ်မှာ ကျွန်ုပ်တို့ ချန်ထားရစ်ခဲ့မယ့် ဒစ်ဂျစ်တယ် အချက်အလက်တွေအပေါ်မှာပဲ မူတည်နေပါတယ်။
အချိန်လေး နည်းနည်း ရတိုင်းမှာ Social Media ပေါ်မှာ စာဖတ်ရုံသက်သက်တင် မဟုတ်ဘဲ မြန်မာဝီကီပီးဒီးယားဆီ သွားရောက်ပြီး ဆောင်းပါးလေးတွေ ဝင်ရောက် ရေးသား၊ တည်းဖြတ်ရင်း ကျွန်ုပ်တို့ရဲ့ မိခင်ဘာသာစကားနဲ့ နောင်အနာဂတ် AI ခေတ်အတွက် အုတ်တစ်ချပ် သဲတစ်ပွင့်အဖြစ် ဝိုင်းဝန်း ပါဝင်ကြဖို့ တိုက်တွန်းလိုက်ရပါတယ်။