Search Data Lam Hnyin

ကျောက်ထက်အက္ခရာမှသည် ဒစ်ဂျစ်တယ်မှတ်တမ်းဆီသို့ — ရှေးဟောင်းစာပေများကို ပြန်လည်ရှင်သန်စေမည့် OCR နှင့် မြန်မာ့အမွေအနှစ် ထိန်းသိမ်းရေး

ရာစုနှစ်ပေါင်းများစွာ ကြံ့ကြံ့ခံခဲ့တဲ့ ကျောက်စာ၊ ပေပုရပိုက်နဲ့ မင်စာတွေကို ဒစ်ဂျစ်တယ်ကမ္ဘာထဲ ဘယ်လိုခေါ်ဆောင်မလဲ။ ရှေးဟောင်းစာပေ မှတ်တမ်းတင်ခြင်းဆိုင်ရာ စိန်ခေါ်မှုများ၊ OCR နည်းပညာရဲ့ အခန်းကဏ္ဍနဲ့ ပျူဗျည်း ၃၃ လုံးကို စနစ်တကျ ဒေတာပြောင်းလဲခဲ့တဲ့ ပြည်တွင်း သုတေသနခြေလှမ်းအကြောင်း

Share

ကျွန်ုပ်တို့ မြန်မာနိုင်ငံဟာ သမိုင်းအမွေအနှစ် ကြွယ်ဝတဲ့ နိုင်ငံတစ်ခုပါ။ ပုဂံ၊ သရေခေတ္တရာ၊ ဟန်လင်း စတဲ့ သမိုင်းဝင်နယ်မြေတွေဆီ ရောက်သွားတိုင်း စေတီပုထိုးတွေရဲ့ နံရံပေါ်က မင်စာတွေ၊ ကျောက်စာတိုင်တွေနဲ့ ဘုန်းတော်ကြီးကျောင်းတွေထဲက ပေပုရပိုက်တွေကို မြင်တွေ့ဖူးကြပါလိမ့်မယ်။ အဲဒီ စာပေမှတ်တမ်းတွေဟာ လွန်ခဲ့တဲ့ နှစ်ပေါင်း ရာချီ၊ ထောင်ချီက ဘိုးဘေးဘီဘင်တွေရဲ့ ယဉ်ကျေးမှု၊ လူမှုဘဝ၊ ဥပဒေနဲ့ အတွေးအခေါ်တွေကို ဖော်ပြနေတဲ့ သမိုင်းသက်သေ အစစ်အမှန်တွေ ဖြစ်ပါတယ်။

ဒါပေမယ့် ဒီသမိုင်းသက်သေတွေဟာ အချိန်ရဲ့ တိုက်စားမှုကိုတော့ ထာဝရ မတွန်းလှန်နိုင်ပါဘူး။ ရာသီဥတုဒဏ်၊ သဘာဝဘေးအန္တရာယ်တွေ၊ ပိုးမွှားဒဏ်နဲ့ လူတွေရဲ့ မတော်တဆ ထိခိုက်စေမှုတွေကြောင့် နှစ်ကာလ ကြာမြင့်လာတာနဲ့အမျှ စာသားတွေ မှေးမှိန်ပျက်စီးလာနေပါတယ်။ စာကြည့်တိုက်တွေနဲ့ ပြတိုက်တွေထဲမှာ ဓာတ်ပုံရိုက်ပြီး သိမ်းထားရုံနဲ့တင် မလုံလောက်တော့ပါဘူး။ အဲဒီစာသားတွေကို ကွန်ပျူတာက နားလည်ပြီး ရှာဖွေဖတ်ရှုနိုင်တဲ့ ဒစ်ဂျစ်တယ်စာသား (Editable & Searchable Text) အဖြစ် မပြောင်းလဲနိုင်ဘူးဆိုရင် နောင်လာနောက်သားတွေ လက်ထက်မှာ ဒီအမွေအနှစ်တွေဟာ ပျောက်ကွယ်သွားနိုင်တဲ့ အန္တရာယ် ရှိနေပါတယ်။

ဒီနေရာမှာ မရှိမဖြစ် အရေးပါလာတဲ့ နည်းပညာကတော့ Optical Character Recognition (OCR) စနစ်ပဲ ဖြစ်ပါတယ်။


OCR ဆိုတာ ဘာလဲ၊ ရှေးဟောင်းစာပေတွေအတွက် ဘာကြောင့် ခက်ခဲရတာလဲ

ရိုးရိုးရှင်းရှင်း ပြောရရင် OCR ဆိုတာ ဓာတ်ပုံ ဒါမှမဟုတ် စကင်ဖတ်ထားတဲ့ စာရွက်စာတမ်းပုံရိပ်ထဲက အက္ခရာစာလုံးတွေကို ကွန်ပျူတာက အလိုအလျောက် မှတ်မိဖတ်ရှုပြီး စာရိုက်ထားသလို ကူးယူပြင်ဆင်လို့ရတဲ့ စာသားအဖြစ် ပြောင်းလဲပေးတဲ့ Computer Vision နည်းပညာတစ်ခု ဖြစ်ပါတယ်။

မျက်မှောက်ခေတ်မှာ ခေတ်ပေါ် အင်္ဂလိပ်စာ ဒါမှမဟုတ် စာစီစာရိုက်ပြီးသား မြန်မာစာတွေကို OCR ဖတ်ဖို့ဆိုတာ သိပ်မခက်ခဲတော့ပါဘူး။ စာလုံးတွေက ညီညာရှင်းလင်းနေပြီး ပုံနှိပ်စက်နဲ့ ရိုက်ထားတာဖြစ်လို့ ကွန်ပျူတာ အလွယ်တကူ မှတ်မိနိုင်ပါတယ်။ ဒါပေမယ့် ရှေးဟောင်း ကျောက်စာတွေ၊ ပေပုရပိုက်တွေနဲ့ လက်ရေးမူတွေကို OCR စနစ်နဲ့ ဖတ်မယ်ဆိုရင်တော့ ကြီးမားတဲ့ နည်းပညာဆိုင်ရာ စိန်ခေါ်မှုတွေနဲ့ ရင်ဆိုင်ရပါတယ် -

၁။ မျက်နှာပြင် ပျက်စီးမှုများ — ကျောက်သားတွေ ကွဲအက်နေတာ၊ ရေငွေ့နဲ့ မှိုဒဏ်ကြောင့် ပေရွက်တွေ အရောင်ပြောင်းနေတာ၊ မင်စွန်းတွေ ထင်းနေတာတွေဟာ AI မျက်စိကို အကြီးအကျယ် ရှုပ်ထွေးစေပါတယ်။

၂။ လက်ရေးမူ ကွဲပြားမှု — ကျောက်ဆစ်ပညာရှင် ဒါမှမဟုတ် ပေစာရေးသူ တစ်ဦးချင်းစီရဲ့ လက်ရေးဟန်၊ စာလုံးအကြီးအသေးနဲ့ မျဉ်းကွေးပုံစံတွေ မတူညီကြပါဘူး။

၃။ စံသတ်မှတ်ချက်နှင့် ဒေတာ မရှိခြင်း — ခေတ်သစ် ကွန်ပျူတာ အယ်လ်ဂိုရီသမ်တွေ လေ့ကျင့်ဖို့အတွက် ရှေးဟောင်းစာပေဆိုင်ရာ Dataset တွေဟာ ကမ္ဘာမှာရော မြန်မာပြည်မှာပါ လုံးဝနီးပါး ရှားပါးနေတာ ဖြစ်ပါတယ်။


ဒစ်ဂျစ်တယ်ခေတ်ဆီသို့ ပျူအက္ခရာများ — DatarrX ၏ ရှေ့ဆောင် သုတေသန

ဒီလို ကြီးမားတဲ့ အခက်အခဲတွေကြားကနေ မြန်မာ့သမိုင်းအမွေအနှစ်ကို AI နည်းပညာနဲ့ ချိတ်ဆက်ဖို့ လက်တွေ့ကျကျ ခြေလှမ်းစတင်လိုက်တဲ့ ပရောဂျက်တစ်ခု ပေါ်ထွက်လာခဲ့ပါတယ်။ အဲဒါကတော့ DatarrX (ဒေတာ-အက်စ်) အဖွဲ့အစည်းမှ ဦးဆောင်ဖန်တီးပြီး Hugging Face ပေါ်မှာ အများပြည်သူ လွတ်လပ်စွာ အသုံးပြုနိုင်အောင် ဖြန့်ဝေပေးထားတဲ့ Pyu Handwritten Consonant Dataset ပဲ ဖြစ်ပါတယ်။

မြန်မာ့သမိုင်းမှာ ပျူစာပေဟာ အစောဆုံးနဲ့ အရေးအပါဆုံးသော အခြေခံအုတ်မြစ်တစ်ခု ဖြစ်ပေမဲ့ ကွန်ပျူတာနဲ့ AI လောကမှာတော့ ပျူစာကို နားလည်တဲ့ မော်ဒယ်ရယ်လို့ မရှိခဲ့ပါဘူး။ ဒီကွက်လပ်ကို ဖြည့်ဆည်းဖို့အတွက် DatarrX ၏ တည်ထောင်သူ ခန့်ဆင့်ဟိဏ်း (Khant Sint Heinn / Kalix Louis) ဟာ သီရိပျံချီ ဦးသာမြတ် ရေးသားပြုစုခဲ့တဲ့ သမိုင်းဝင် ကျမ်းကိုးစာအုပ်ပါ မူရင်းစံနှုန်းတွေကို အခြေခံပြီး ရှေးဟောင်း ပျူဗျည်း ၃၃ လုံးအတွက် စနစ်တကျ Benchmark Dataset တစ်ခုကို တည်ဆောက်ခဲ့ပါတယ်။

ဒီ Dataset ဟာ သာမန် ဓာတ်ပုံစုစည်းမှုသက်သက် မဟုတ်ဘဲ ခေတ်မီ Machine Learning Pipeline တွေမှာ တိုက်ရိုက် အသုံးပြုနိုင်အောင် သိပ္ပံနည်းကျ စီမံထားတာ ဖြစ်ပါတယ် -

  • အတန်းအစားနှင့် ပမာဏ — ပျူဗျည်း ၃၃ လုံးအတွက် မတူညီတဲ့ လက်ရေးဟန်စတိုင် ၂၅ မျိုးစီဖြင့် မူရင်းလက်ရေးပုံ ၈၂၅ ပုံကို ဖန်တီးခဲ့ပါတယ်။
  • Data Augmentation — လက်တွေ့ ကျောက်စာတွေမှာ တွေ့ရတတ်တဲ့ အနေအထားတွေအတိုင်း စောင်းခြင်း၊ ရွေ့ခြင်း၊ မှုန်ဝါးခြင်း (Gaussian Blur) နဲ့ ရှုထောင့်ပြောင်းလဲမှုတွေကို သင်္ချာနည်းအရ ပုံတူပွားဖန်တီးပြီး စုစုပေါင်း Grayscale ပုံရိပ် ၅,၇၇၅ ပုံအထိ တိုးမြှင့်လေ့ကျင့်ပေးထားပါတယ်။
  • စံနှုန်းမီ Format — ဒေတာတွေကို ခေတ်မီ Deep Learning Framework တွေ (PyTorch, TensorFlow) နဲ့ အလွယ်တကူ ချိတ်ဆက်နိုင်ဖို့ Apache Parquet Format ဖြင့် ထုတ်ဝေထားပြီး၊ ပုံရိပ်အရွယ်အစားကို 224 × 224 Pixels သတ်မှတ်ထားကာ ခေတ်သစ် မြန်မာစာ (Modern Myanmar Script) ရော၊ အင်္ဂလိပ် အသံထွက်ဖလှယ်မှု (Romanized Transliteration) ပါ စနစ်တကျ Label တွဲပေးထားပါတယ်။

ဒီ Dataset နဲ့ ပတ်သက်တဲ့ နည်းပညာဆိုင်ရာ အသေးစိတ် သုတေသနစာတမ်းကိုလည်း “Preserving Myanmar’s Ancient Heritage: A Novel Dataset and ResNet Architecture for Pyu Character Recognition” ဆိုတဲ့ ခေါင်းစဉ်နဲ့ Research Square (Preprint DOI: 10.21203/rs.3.rs-10427861/v1) မှာ တရားဝင် တင်ပြထားပြီး ဖြစ်ပါတယ်။

အထူးသဖြင့် ဒီဒေတာအစုအဝေး တစ်ခုလုံးကို Creative Commons Attribution 4.0 International (CC BY 4.0) လိုင်စင်နဲ့ အခမဲ့ ဖွင့်ချပေးထားတဲ့အတွက် ပြည်တွင်းပြည်ပက သုတေသီတွေ၊ ကျောင်းသားတွေနဲ့ ရှေးဟောင်းသုတေသန ဝါသနာရှင်တွေအနေနဲ့ ပျူစာ OCR မော်ဒယ်တွေ ဖန်တီးရာမှာဖြစ်စေ၊ သုတေသန စမ်းသပ်မှုတွေ လုပ်ဆောင်ရာမှာဖြစ်စေ လွတ်လပ်စွာ ရယူ အသုံးချနိုင်မှာ ဖြစ်ပါတယ်။


ရှေးဟောင်းစာပေများကို OCR ပြုလုပ်ခြင်းဖြင့် ဘာတွေ ရရှိလာနိုင်မလဲ

ကျောက်စာနဲ့ ပေစာတွေကို ဒီလိုမျိုး စနစ်တကျ ဒစ်ဂျစ်တယ် အသွင်ပြောင်းလဲပြီး OCR စနစ်တွေ အောင်မြင်စွာ တည်ဆောက်နိုင်မယ်ဆိုရင် ကျွန်ုပ်တို့ရဲ့ သမိုင်းသုတေသနလောကမှာ အံ့မခန်း အကျိုးကျေးဇူးတွေ ရရှိလာမှာ ဖြစ်ပါတယ် -

ပထမဆုံးအနေနဲ့ ရှာဖွေရ လွယ်ကူမြန်ဆန်လာခြင်း (Full-text Searchability) ပါပဲ။ အရင်ကဆိုရင် သမိုင်းဆရာတစ်ယောက်ဟာ အကြောင်းအရာတစ်ခုကို သိချင်ရင် ကျောက်စာချပ် ရာပေါင်းများစွာကို မျက်စိနဲ့ တစ်လုံးချင်း လိုက်ရှာဖတ်ရပါတယ်။ OCR စနစ်နဲ့ ဒစ်ဂျစ်တယ် စာသားအဖြစ် ပြောင်းထားပြီးသား ဖြစ်ရင်တော့ Google မှာ ရှာသလိုမျိုး စက္ကန့်ပိုင်းအတွင်း ရှာဖွေဖတ်ရှုနိုင်မှာ ဖြစ်ပါတယ်။

ဒုတိယအချက်ကတော့ သမိုင်းဆိုင်ရာ အချက်အလက်များကို AI ဖြင့် ချိတ်ဆက် လေ့လာနိုင်ခြင်း (Digital Humanities) ဖြစ်ပါတယ်။ ရာစုနှစ်အလိုက် စကားလုံး အသုံးအနှုန်း ပြောင်းလဲလာပုံ၊ မင်းဆက်အလိုက် အခွန်အခ ကောက်ခံပုံတွေနဲ့ လူမှုစီးပွား ဆင့်ကဲပြောင်းလဲမှုတွေကို Data Science နည်းပညာတွေ သုံးပြီး ကြီးမားတဲ့ အတိုင်းအတာနဲ့ ခွဲခြမ်းစိတ်ဖြာနိုင်လာပါလိမ့်မယ်။

တတိယအချက်ကတော့ စာပေလက်ရာများ ထာဝရ မပျောက်ပျက်အောင် ထိန်းသိမ်းနိုင်ခြင်း ဖြစ်ပါတယ်။ မူရင်း ကျောက်စာချပ်တွေ ပျက်စီးသွားခဲ့ရင်တောင်မှ အဲဒီအထဲမှာ ပါဝင်တဲ့ စာသားနဲ့ အဓိပ္ပာယ်တွေဟာ ဒစ်ဂျစ်တယ်ကမ္ဘာထဲမှာ မပျောက်မပျက် ဆက်လက် ရှင်သန်နေမှာ ဖြစ်ပါတယ်။


ရှေ့ဆက်ရမယ့် ခရီး

ပျူလက်ရေးမူ ဒေတာအစုအဝေး ပေါ်ထွက်လာတာဟာ မြန်မာ့ ရှေးဟောင်းစာပေ OCR နယ်ပယ်အတွက် အင်မတန် အားတက်စရာကောင်းတဲ့ ပထမခြေလှမ်းတစ်ခု ဖြစ်ပါတယ်။ ဒါပေမယ့် ကျွန်ုပ်တို့ ရှေ့မှာ လုပ်ဆောင်စရာတွေ အများကြီး ကျန်ရှိနေပါသေးတယ်။ ပုဂံခေတ် ကျောက်စာများ၊ အင်းဝခေတ် ပေစာများ၊ ကုန်းဘောင်ခေတ် မင်စာများနှင့် ရှေးဟောင်း တိုင်းရင်းသား စာပေလက်ရာ မြောက်မြားစွာတို့ဟာ ဒစ်ဂျစ်တယ် အလင်းရောင် ရောက်ရှိလာမယ့် အချိန်ကို စောင့်ကြိုနေကြဆဲပါ။

ဒါဟာ သမိုင်းပညာရှင်တွေချည်းပဲ လုပ်ဆောင်လို့ ရနိုင်တဲ့ ကိစ္စမဟုတ်သလို၊ နည်းပညာရှင်တွေချည်းပဲ ဖန်တီးလို့လည်း မပြည့်စုံနိုင်ပါဘူး။ ဘာသာဗေဒ ပညာရှင်များ၊ ရှေးဟောင်းသုတေသီများနှင့် ကွန်ပျူတာ သိပ္ပံပညာရှင်များ လက်တွဲပူးပေါင်းပြီး ဒေတာတွေကို စနစ်တကျ ပြုစုသန့်စင်ကြမှသာလျှင် ကျွန်ုပ်တို့ရဲ့ တန်ဖိုးမဖြတ်နိုင်တဲ့ စာပေအမွေအနှစ်တွေကို ဒစ်ဂျစ်တယ်ခေတ်ရဲ့ အလယ်မှာ ဂုဏ်ယူစွာ ဆက်လက် လက်ဆင့်ကမ်းနိုင်မှာ ဖြစ်ပါတယ်။

Keep reading

Generative AI ခေတ်မှာ အင်တာနက်၊ ဆိုရှယ်မီဒီယာနဲ့ ရှာဖွေရေးအင်ဂျင်တွေကို လွှမ်းမိုးလာတဲ့ 'AI Slop' (တန်ဖိုးမဲ့ အစုလိုက် အပြုံလိုက် AI ဒေတာများ) ၏ သဘောတရား၊ ဆိုးကျိုးများနှင့် ရှောင်လွှဲနိုင်မည့် နည်းလမ်းများ...

နည်းပညာလောကမှာ မကြာခဏ ရောထွေးသုံးစွဲလေ့ရှိတဲ့ ဉာဏ်ရည်တုနည်းပညာ (AI)၊ ဒေတာအခြေပြုသင်ယူမှုစနစ် (ML) နဲ့ အလွှာစုံသင်ယူမှုစနစ် (DL) တို့ရဲ့ အခြေခံ သဘောတရား၊ အလုပ်လုပ်ပုံနဲ့ ကွာခြားချက်များကို ရိုးရှင်းစွာ ရှင်းပြချက်...

ဉာဏ်ရည်တုနည်းပညာ (AI)၊ ဒေတာအခြေပြုသင်ယူမှုစနစ် (ML) နဲ့ အလွှာစုံသင်ယူမှုစနစ် (DL) တွေမှာ အယ်လ်ဂိုရီသမ် ဘယ်လောက်ပဲ ကောင်းမွန်ပါစေ ဒေတာအရည်အသွေး ညံ့ဖျင်းပါက မည်သို့သော အမှားအယွင်းနှင့် ဆိုးကျိုးများ ကြုံတွေ့ရနိုင်သနည်း...