'Garbage in, garbage out' ဆိုတဲ့ data science ရဲ့ classic principle — data ရေချို/သန့်ရှင်းမှုမရှိရင် analysis result ဘယ်လောက် sophisticated ဖြစ်ဖြစ် ယုံကြည်စိတ်မချရပါဘူး။ Data scientist တွေရဲ့ အချိန်ကို ၈၀% ခန့် data cleaning အတွက်ပဲ သုံးရတယ်လို့ industry survey တွေက ပြသပါတယ်။
Data ဘာကြောင့် 'မသန့်' တတ်လဲ
Missing value (form field ကို user ကျော်ခဲ့), duplicate entry (record တစ်ခု ၂ ကြိမ် entry လုပ်မိ), inconsistent format (တစ်နေရာမှာ '2026-01-15', တစ်နေရာမှာ '15/01/2026'), typo/inconsistent category ('USA', 'United States', 'U.S.') — ဒီ issue အားလုံးက real-world data collection process ကနေ သဘာဝအလျောက် ဖြစ်ပေါ်ပါတယ်။
| Data quality issue | ဖြေရှင်းနည်း |
|---|---|
| Missing value | ဖျက် (drop) ဒါမှမဟုတ် average/median ဖြင့် ဖြည့် (fillna) |
| Duplicate row | drop_duplicates() ဖြင့် ဖယ်ရှား |
| Inconsistent format | Standard format တစ်ခုတည်းအဖြစ် ပြောင်း (parse + reformat) |
| Outlier (data ရော outlier) | Business context အရ စစ်ဆေး, error လား/legit data လား ဆုံးဖြတ် |
Pandas ဖြင့် လက်တွေ့ Cleaning Workflow
df.isnull().sum() ကို run ရင် column တစ်ခုစီမှာ missing value ဘယ်နှစ်ခုရှိလဲ ချက်ချင်း ကြည့်နိုင်ပါတယ် — df.duplicated().sum() ကို run ရင် duplicate row အရေအတွက်ကို သိရှိနိုင်ပါတယ်။ Data cleaning ကို 'တစ်ကြိမ်ပြီးရင် ပြီးပြီ' လို့ မယူဆသင့်ပါ — data source အသစ် ရောက်လာတိုင်း cleaning process ကို ထပ်ခါထပ်ခါ run ရမှာမို့ script/function အဖြစ် reusable ဖြစ်အောင် ရေးထားတာက ကောင်းပါတယ်။
Outlier ကို အလွယ်တကူ မဖယ်ပါနှင့်
Outlier တွေအားလုံးက 'error' မဟုတ်ပါဘူး — fraud detection project တစ်ခုမှာ outlier ကိုယ်တိုင်ဟာ 'signal' (interesting data point) ဖြစ်နိုင်ပါတယ်, context မသိဘဲ ဖယ်ပစ်မိရင် အရေးကြီးသော insight ပျောက်သွားနိုင်ပါတယ်။
အနှစ်ချုပ်
Data cleaning က data analysis project တစ်ခုရဲ့ 'ဟန်မပါတဲ့' ဒါပေမယ့် အရေးအကြီးဆုံး အဆင့်ပါ — missing value, duplicate, inconsistent format ကို systematic စွာ ဖြေရှင်းထားမှ ဒီ data အပေါ် အခြေခံထားတဲ့ analysis/decision ကို ယုံကြည်စိတ်ချနိုင်ပါတယ်။
