Thuta Learning
Data & Databases

Data ကို ဘယ်လို သန့်စင်ရမလဲ

Real-world data က perfect မဖြစ်ပါဘူး — missing value, duplicate row, inconsistent format ကို ဖြေရှင်းတဲ့ Data Cleaning ဘာကြောင့် analysis project ရဲ့ အရေးကြီးဆုံးအဆင့်ဖြစ်လဲ လေ့လာပါ။

Learning Platform Editorial · 5 min · Updated on 8/24/2026

Data ကို ဘယ်လို သန့်စင်ရမလဲ cover illustration

'Garbage in, garbage out' ဆိုတဲ့ data science ရဲ့ classic principle — data ရေချို/သန့်ရှင်းမှုမရှိရင် analysis result ဘယ်လောက် sophisticated ဖြစ်ဖြစ် ယုံကြည်စိတ်မချရပါဘူး။ Data scientist တွေရဲ့ အချိန်ကို ၈၀% ခန့် data cleaning အတွက်ပဲ သုံးရတယ်လို့ industry survey တွေက ပြသပါတယ်။

Data ဘာကြောင့် 'မသန့်' တတ်လဲ

Missing value (form field ကို user ကျော်ခဲ့), duplicate entry (record တစ်ခု ၂ ကြိမ် entry လုပ်မိ), inconsistent format (တစ်နေရာမှာ '2026-01-15', တစ်နေရာမှာ '15/01/2026'), typo/inconsistent category ('USA', 'United States', 'U.S.') — ဒီ issue အားလုံးက real-world data collection process ကနေ သဘာဝအလျောက် ဖြစ်ပေါ်ပါတယ်။

Data quality issueဖြေရှင်းနည်း
Missing valueဖျက် (drop) ဒါမှမဟုတ် average/median ဖြင့် ဖြည့် (fillna)
Duplicate rowdrop_duplicates() ဖြင့် ဖယ်ရှား
Inconsistent formatStandard format တစ်ခုတည်းအဖြစ် ပြောင်း (parse + reformat)
Outlier (data ရော outlier)Business context အရ စစ်ဆေး, error လား/legit data လား ဆုံးဖြတ်

Pandas ဖြင့် လက်တွေ့ Cleaning Workflow

df.isnull().sum() ကို run ရင် column တစ်ခုစီမှာ missing value ဘယ်နှစ်ခုရှိလဲ ချက်ချင်း ကြည့်နိုင်ပါတယ် — df.duplicated().sum() ကို run ရင် duplicate row အရေအတွက်ကို သိရှိနိုင်ပါတယ်။ Data cleaning ကို 'တစ်ကြိမ်ပြီးရင် ပြီးပြီ' လို့ မယူဆသင့်ပါ — data source အသစ် ရောက်လာတိုင်း cleaning process ကို ထပ်ခါထပ်ခါ run ရမှာမို့ script/function အဖြစ် reusable ဖြစ်အောင် ရေးထားတာက ကောင်းပါတယ်။

Outlier ကို အလွယ်တကူ မဖယ်ပါနှင့်

Outlier တွေအားလုံးက 'error' မဟုတ်ပါဘူး — fraud detection project တစ်ခုမှာ outlier ကိုယ်တိုင်ဟာ 'signal' (interesting data point) ဖြစ်နိုင်ပါတယ်, context မသိဘဲ ဖယ်ပစ်မိရင် အရေးကြီးသော insight ပျောက်သွားနိုင်ပါတယ်။

အနှစ်ချုပ်

Data cleaning က data analysis project တစ်ခုရဲ့ 'ဟန်မပါတဲ့' ဒါပေမယ့် အရေးအကြီးဆုံး အဆင့်ပါ — missing value, duplicate, inconsistent format ကို systematic စွာ ဖြေရှင်းထားမှ ဒီ data အပေါ် အခြေခံထားတဲ့ analysis/decision ကို ယုံကြည်စိတ်ချနိုင်ပါတယ်။

Sources

Related content