Search Data Lam Hnyin

'Garbage In, Garbage Out' — အရည်အသွေးမမီသော ဒေတာများက AI အပေါ် ဖြစ်ပေါ်စေသည့် ဆိုးကျိုးများ

ဉာဏ်ရည်တုနည်းပညာ (AI)၊ ဒေတာအခြေပြုသင်ယူမှုစနစ် (ML) နဲ့ အလွှာစုံသင်ယူမှုစနစ် (DL) တွေမှာ အယ်လ်ဂိုရီသမ် ဘယ်လောက်ပဲ ကောင်းမွန်ပါစေ ဒေတာအရည်အသွေး ညံ့ဖျင်းပါက မည်သို့သော အမှားအယွင်းနှင့် ဆိုးကျိုးများ ကြုံတွေ့ရနိုင်သနည်း...

Share

ကွန်ပျူတာသိပ္ပံလောကမှာ ဆယ်စုနှစ်ပေါင်းများစွာ ကတည်းက လက်ကိုင်ထားခဲ့တဲ့ အခြေခံ သဘောတရားတစ်ခု ရှိပါတယ်။ အဲဒါကတော့ “Garbage In, Garbage Out” (GIGO) ဆိုတဲ့ စကားစုပါပဲ။ မြန်မာလို အလွယ်ပြောရရင် “အမှိုက်ထည့်ရင် အမှိုက်ပဲ ပြန်ထွက်မယ်” ဆိုတဲ့ အဓိပ္ပာယ် ဖြစ်ပါတယ်။

ဒီသဘောတရားဟာ ယနေ့ခေတ် ဉာဏ်ရည်တုနည်းပညာ (Artificial Intelligence - AI)၊ ဒေတာအခြေပြုသင်ယူမှုစနစ် (Machine Learning - ML) နဲ့ အလွှာစုံသင်ယူမှုစနစ် (Deep Learning - DL) ခေတ်ကို ရောက်လာတဲ့အခါ ပိုမိုပြင်းထန်တဲ့ ရိုက်ခတ်မှုတစ်ခု ဖြစ်လာပါတယ်။

လူအများစုက AI အဆင်မပြေဖြစ်တဲ့အခါ ကွန်ပျူတာ အယ်လ်ဂိုရီသမ် ဒါမှမဟုတ် Model မကောင်းလို့လို့ပဲ အပြစ်တင်တတ်ကြပါတယ်။ ဒါပေမယ့် လက်တွေ့မှာတော့ AI ရဲ့ ကျရှုံးမှု ၈၀ ရာခိုင်နှုန်းကျော်ဟာ သူတို့ကို လေ့ကျင့်သင်ကြားပေးလိုက်တဲ့ “ဒေတာ (Data) ညံ့ဖျင်းမှု” ကြောင့်သာ အဓိက ဖြစ်ရတာပါ။


၁။ AI, ML နှင့် DL တို့ ဒေတာအပေါ် မှီခိုပုံ

ပြဿနာကို နားလည်ဖို့အတွက် ဒီနည်းပညာ ၃ ခု အလုပ်လုပ်ပုံကို အကျဉ်းရုံး ကြည့်ဖို့ လိုပါတယ် -

  • ဉာဏ်ရည်တုနည်းပညာ (AI) — လူသားတွေလို ဆုံးဖြတ်ချက်ချနိုင်ပြီး ပြဿနာဖြေရှင်းနိုင်အောင် ဖန်တီးထားတဲ့ စနစ်ကြီး ဖြစ်ပါတယ်။
  • ဒေတာအခြေပြုသင်ယူမှုစနစ် (Machine Learning - ML) — ပရိုဂရမ်မာက စည်းမျဉ်းတွေ အကုန်လိုက်ရေးမပေးဘဲ၊ ကွန်ပျူတာကို အချက်အလက် (Data) တွေ ကျွေးပြီး အဲဒီဒေတာထဲက ပုံစံတူများ (Patterns) ကို ကိုယ်တိုင် ရှာဖွေသင်ယူစေတဲ့ စနစ် ဖြစ်ပါတယ်။
  • အလွှာစုံသင်ယူမှုစနစ် (Deep Learning - DL) — လူ့ဦးနှောက်အာရုံကြောကွန်ရက်ကို အတုယူထားတဲ့ အလွှာပေါင်းများစွာနဲ့ ဒေတာအမြောက်အမြားကို လေ့လာပြီး အနုစိတ် အချက်အလက်တွေကို အလိုအလျောက် ဆွဲထုတ်သင်ယူတဲ့ အဆင့်မြင့် စနစ် ဖြစ်ပါတယ်။

ဒီစနစ်တွေအားလုံးရဲ့ ဘုံသဘောတရားကတော့ “ဒေတာမရှိရင် သင်ယူလို့မရသလို၊ ဒေတာမှားရင် အမှားကိုပဲ သင်ယူသွားမယ်” ဆိုတဲ့ အချက်ပါပဲ။


၂။ ဒေတာ မသန့်ရှင်းခြင်း (Garbage In) ဆိုတာ ဘာတွေလဲ

AI ထဲကို ရောက်သွားတတ်တဲ့ အမှိုက်ဒေတာတွေမှာ အောက်ပါ အချက်တွေ ပါဝင်ပါတယ် -

၁။ မပြည့်စုံခြင်းနှင့် အမှားအယွင်းများခြင်း (Noise & Errors) — စာလုံးပေါင်းသတ်ပုံ အမှားများ၊ ဖောင့်စံနှုန်းမညီဘဲ ပျက်စီးနေသော စာသားများ၊ ပုံရိပ်အရည်အသွေး ညံ့ဖျင်းပြီး မှိန်ပြယ်နေသော ပုံများ။

၂။ ဘက်လိုက်မှု ပါဝင်နေခြင်း (Bias) — လူ့အဖွဲ့အစည်းရဲ့ အမုန်းစကားများ၊ လူမျိုးရေး၊ ကျား/မ ခွဲခြားဆက်ဆံမှုဆိုင်ရာ အစွဲများ ပါဝင်နေသော အချက်အလက်များ။

၃။ တံဆိပ်တပ် မှားယွင်းခြင်း (Mislabelled Data) — ML လေ့ကျင့်ရာမှာ ခွေးပုံကို ကြောင်လို့ Label မှားတပ်ထားတာမျိုး သို့မဟုတ် ဆေးမှတ်တမ်း အဖြေမှားများကို ထည့်သွင်းထားမိခြင်း။

၄။ မညီမျှသော ဒေတာ (Imbalanced Data) — ဥပမာအားဖြင့် မြန်မာစာတွင် စာစကား ဒေတာသာ အဆမတန်များပြီး နေ့စဉ် အပြောစကား ဒေတာ လုံးဝ မပါဝင်ခြင်းမျိုး။


၃။ အရည်အသွေးမမီသော ဒေတာကြောင့် ဖြစ်ပေါ်လာသည့် ဆိုးကျိုးများ (Garbage Out)

အကယ်၍ ညံ့ဖျင်းတဲ့ ဒေတာတွေကို AI, ML, DL မော်ဒယ်တွေထဲ ထည့်သွင်းလေ့ကျင့်လိုက်ရင် အောက်ပါ ကြီးမားတဲ့ ဆိုးကျိုးတွေ ဖြစ်ပေါ်လာပါတယ် -

က။ လွဲမှားသော ဆုံးဖြတ်ချက်များနှင့် အန္တရာယ်များ

ဆေးဘက်ဆိုင်ရာ AI စနစ်တစ်ခုကို မပြည့်စုံတဲ့ လူနာဒေတာတွေနဲ့ လေ့ကျင့်ထားမယ်ဆိုရင် ရောဂါရှာဖွေမှု အဖြေမှား ထွက်လာပြီး လူ့အသက်ကိုပါ ထိခိုက်စေနိုင်ပါတယ်။ အလားတူ ဘဏ်လုပ်ငန်းသုံး ML စနစ်တွေမှာလည်း အချက်အလက် မှားယွင်းပါက ချေးငွေ လျှောက်ထားသူရဲ့ အရည်အချင်းကို မှားယွင်း ငြင်းပယ်တာမျိုးတွေ ဖြစ်လာနိုင်ပါတယ်။

ခ။ AI စိတ်ကူးယဉ် အမှားများ (Hallucination)

Large Language Model တွေဟာ အင်တာနက်ပေါ်က မမှန်မကန် သတင်းအတုတွေ၊ စံမညီတဲ့ စာသားတွေကို ဖတ်ရှုလေ့ကျင့်ထားရတဲ့အခါ မေးခွန်းတစ်ခုကို မေးလိုက်ရင် စိတ်ကူးယဉ်ပြီး အချက်အလက် အမှားတွေကို အမှန်လုပ်ကာ ယုံကြည်မှုအပြည့်နဲ့ ပြန်လည် ဖြေဆိုတတ်ကြပါတယ်။

ဂ။ ဘက်လိုက်မှုနှင့် ခွဲခြားဆက်ဆံမှုများ ပိုမိုဆိုးရွားလာခြင်း

Deep Learning မော်ဒယ်တွေဟာ ဒေတာထဲမှာ ပါတဲ့ လူသားတွေရဲ့ မသိစိတ် အစွဲတွေကို အဆပေါင်းများစွာ ပိုမိုချဲ့ထွင် သင်ယူတတ်ကြပါတယ်။ ဥပမာ - ဝန်ထမ်းခေါ်ယူရေး AI တစ်ခုကို အမျိုးသား ဦးစားပေး ရွေးချယ်ထားတဲ့ အတိတ်ဒေတာတွေနဲ့ လေ့ကျင့်လိုက်ရင် အမျိုးသမီး လျှောက်ထားသူတွေကို အကြောင်းမဲ့ အမှတ်လျှော့ချတဲ့ ဘက်လိုက်စနစ်ကြီး ထွက်ပေါ်လာပါတယ်။

ဃ။ မြန်မာစာ ကဲ့သို့သော ရင်းမြစ်နည်း ဘာသာစကားများတွင် အဆင်မပြေဖြစ်ခြင်း

မြန်မာစာ NLP မှာလည်း အင်တာနက်ပေါ်က ဖောင့်မညီတဲ့ ဇော်ဂျီ/ယူနီကုဒ် ရောထွေးဒေတာတွေ၊ အမုန်းစကားတွေကို မသန့်စင်ဘဲ AI ထဲ ထည့်လိုက်တဲ့အခါ စက်ဘာသာပြန်တွေ အဓိပ္ပာယ် ကမောက်ကမ ဖြစ်တာ၊ စက်ရုပ်ဆန်ဆန် အသုံးအနှုန်းတွေ ထွက်ပေါ်လာတာတွေဟာ GIGO ရဲ့ လက်တွေ့ ဥပမာတွေပဲ ဖြစ်ပါတယ်။


၄။ အဖြေရှာခြင်း — Model-Centric မှ Data-Centric AI ဆီသို့

ဒီပြဿနာတွေကို ကျော်လွှားဖို့အတွက် ကမ္ဘာ့ AI ပညာရှင်တွေဟာ အယ်လ်ဂိုရီသမ် သက်သက်ကိုပဲ အဆင့်မြှင့်တင်နေတဲ့ “Model-Centric” နည်းလမ်းကနေ ဒေတာ အရည်အသွေးကို သိပ္ပံနည်းကျ စိစစ်သန့်စင်တဲ့ “Data-Centric AI” နည်းလမ်းဘက်ကို ကူးပြောင်းလာကြပါပြီ။

အဓိက လုပ်ဆောင်ရမယ့် အချက်တွေကတော့ -

  • Data Cleaning — စာလုံးပေါင်း၊ သင်္ကေတ အမှားများနှင့် မလိုအပ်သော Noise များကို စနစ်တကျ ဖယ်ရှားခြင်း။
  • Rigorous Data Annotation — ဘာသာဗေဒနှင့် သက်ဆိုင်ရာ နယ်ပယ်ကျွမ်းကျင်သူများက ဒေတာများကို နှစ်ဆင့်စစ်ဆေးမှု (Quality Assurance) ပြုလုပ်ခြင်း။
  • Balanced Datasets — နယ်ပယ်စုံ၊ စတိုင်စုံ ပါဝင်သော ဒေတာအစုအဝေးများကို မျှတစွာ စုဆောင်းတည်ဆောက်ခြင်းတို့ ဖြစ်ပါတယ်။

နိဂုံး

AI နည်းပညာတွေ ဘယ်လောက်ပဲ ဆန်းပြားပါစေ၊ Deep Learning အလွှာတွေ ဘယ်လောက်ပဲ ထပ်ထားပါစေ၊ သူတို့ကို ကျွေးမွေးလိုက်တဲ့ ဒေတာဟာ အာဟာရ မဟုတ်ဘဲ အမှိုက်သာ ဖြစ်နေမယ်ဆိုရင် ပြန်ထွက်လာမယ့် ရလဒ်ဟာလည်း အသုံးမဝင်တဲ့ အမှိုက်သာ ဖြစ်နေမှာပါ။

ဒါကြောင့် အရည်အသွေးမြင့်ပြီး ယုံကြည်စိတ်ချရတဲ့ AI စနစ်တွေ ပေါ်ထွန်းလာစေဖို့ဆိုရင် မော်ဒယ်တွေ တည်ဆောက်တာထက် အခြေခံကျတဲ့ “ဒေတာ သန့်စင်မှုနှင့် အရည်အသွေး ထိန်းသိမ်းမှု” ကို အစကတည်းက စနစ်တကျ ရင်းနှီးမြှုပ်နှံ လုပ်ဆောင်ကြရမှာ ဖြစ်ပါတယ်။

Keep reading

Generative AI ခေတ်မှာ အင်တာနက်၊ ဆိုရှယ်မီဒီယာနဲ့ ရှာဖွေရေးအင်ဂျင်တွေကို လွှမ်းမိုးလာတဲ့ 'AI Slop' (တန်ဖိုးမဲ့ အစုလိုက် အပြုံလိုက် AI ဒေတာများ) ၏ သဘောတရား၊ ဆိုးကျိုးများနှင့် ရှောင်လွှဲနိုင်မည့် နည်းလမ်းများ...

ရာစုနှစ်ပေါင်းများစွာ ကြံ့ကြံ့ခံခဲ့တဲ့ ကျောက်စာ၊ ပေပုရပိုက်နဲ့ မင်စာတွေကို ဒစ်ဂျစ်တယ်ကမ္ဘာထဲ ဘယ်လိုခေါ်ဆောင်မလဲ။ ရှေးဟောင်းစာပေ မှတ်တမ်းတင်ခြင်းဆိုင်ရာ စိန်ခေါ်မှုများ၊ OCR နည်းပညာရဲ့ အခန်းကဏ္ဍနဲ့ ပျူဗျည်း ၃၃ လုံးကို စနစ်တကျ ဒေတာပြောင်းလဲခဲ့တဲ့ ပြည်တွင်း သုတေသနခြေလှမ်းအကြောင်း

နည်းပညာလောကမှာ မကြာခဏ ရောထွေးသုံးစွဲလေ့ရှိတဲ့ ဉာဏ်ရည်တုနည်းပညာ (AI)၊ ဒေတာအခြေပြုသင်ယူမှုစနစ် (ML) နဲ့ အလွှာစုံသင်ယူမှုစနစ် (DL) တို့ရဲ့ အခြေခံ သဘောတရား၊ အလုပ်လုပ်ပုံနဲ့ ကွာခြားချက်များကို ရိုးရှင်းစွာ ရှင်းပြချက်...