# Data Cleaning Checklist

## 1. Overview

- [ ] df.info() ဖြင့် column type/count ကို ကနဦးစစ်ဆေးထားခြင်း
- [ ] df.describe() ဖြင့် numerical column summary statistics ကို ကြည့်ထားခြင်း

## 2. Missing Values

- [ ] df.isnull().sum() ဖြင့် column တစ်ခုစီ missing value အရေအတွက် စစ်ထားခြင်း
- [ ] Missing value ကို drop/fill လုပ်ရန် decision ချထားခြင်း (business context အရ)

## 3. Duplicates

- [ ] df.duplicated().sum() ဖြင့် duplicate row အရေအတွက် စစ်ထားခြင်း
- [ ] Duplicate ကို ဖျက်ရန်/ထားရန် ဆုံးဖြတ်ထားခြင်း (legitimate repeat data ဖြစ်နိုင်ခြေ ထည့်တွက်ခြင်း)

## 4. Format Consistency

- [ ] Date/time column အားလုံး format တစ်ခုတည်း ဖြစ်အောင် ပြောင်းထားခြင်း
- [ ] Category column (country name, status) ထဲ typo/inconsistent variant ရှိမရှိ စစ်ထားခြင်း

## 5. Outliers

- [ ] Numerical column ထဲ outlier ရှိမရှိ visualize/statistics ဖြင့် စစ်ထားခြင်း
- [ ] Outlier တစ်ခုစီကို 'error data' လား 'legitimate but rare' လား business context အရ ဆုံးဖြတ်ထားခြင်း

## 6. Reusability

- [ ] Cleaning step အားလုံးကို reusable function/script အဖြစ် ရေးထားခြင်း (data source အသစ် ရောက်တိုင်း ပြန်သုံးနိုင်ရန်)

Checklist ၆ ခုစလုံး ✓ ဖြစ်မှသာ analysis/model building အဆင့်ကို ဆက်လုပ်ပါ။
