Thuta Learning
AI

AI Eval ဆိုတာ ဘာလဲ

AI app က demo မှာ ကောင်းကောင်းအလုပ်လုပ်ပေမယ့် production မှာ ယုံကြည်စိတ်ချရလား ဆိုတာကို ခံစားချက်နဲ့မဟုတ်ဘဲ eval card နဲ့ စနစ်တကျ စစ်ဆေးတတ်အောင် ရိုးရိုးရှင်းရှင်း မိတ်ဆက်ပေးပါမယ်။

Learning Platform Editorial · 6 min · Updated on 8/24/2026

AI Eval ဆိုတာ ဘာလဲ cover illustration

Prompt တစ်ခုကို chat ထဲ စမ်းကြည့်ရင် အဖြေက ချောချောမွေ့မွေ့ ထွက်လာနိုင်ပါတယ်။ ဒါပေမယ့် နောက်တစ်ခါ input နည်းနည်းပြောင်းလိုက်ရင် အဖြေက လုံးဝကွဲသွားနိုင်ပါတယ်။ 'ကောင်းတယ်ထင်တယ်' ဆိုတဲ့ ခံစားချက်တစ်ခုတည်းနဲ့ AI feature ကို production ထုတ်ဖို့ မလုံလောက်ပါဘူး။

Eval (evaluation) ဆိုတာ AI ရဲ့ output ကို input အမျိုးမျိုးနဲ့ ထပ်ခါထပ်ခါ စမ်းပြီး objective rule တစ်ခုနဲ့ pass/fail ချတဲ့ practice ပါ။ Software engineering ရဲ့ unit test ကို AI feature အတွက် ပြန်ဖန်တီးထားသလိုပါပဲ။

Eval Card တစ်ခုမှာ ဘာတွေပါလဲ

Eval card တစ်ခုက input (test case), golden answer (မှန်ကန်တဲ့ expectation) နဲ့ grading rule (ဘယ်လိုမှန်း/မမှန်းကို ဆုံးဖြတ်မလဲ) ဆိုတဲ့ အစိတ်အပိုင်း သုံးခု ပါဝင်ပါတယ်။ Grading rule က 'ဒီစကားလုံးပါရမည်', 'ဒီအရှည်ထက်မကျော်ရ' လို objective ဖြစ်ရပါမယ် — 'ကောင်းရမည်' လို subjective စကားလုံးမသုံးသင့်ပါဘူး။

Test case ကို 'happy path' (ရိုးရိုးအလုပ်ဖြစ်တဲ့ case) တစ်ခုတည်းနဲ့ မရပ်သင့်ပါဘူး။ Data မပြည့်စုံတဲ့ case၊ မဆိုင်ဘဲရောက်လာတဲ့ input (trap case) ကိုပါ ထည့်မှ real-world မှာ ယုံကြည်စိတ်ချရပါတယ်။

ဘယ်အချိန်မှာ eval လိုအပ်လဲ

Prompt/model/context တစ်ခုခု ပြောင်းလိုက်တိုင်း 'တခြားနေရာ ပျက်မသွားဘူးလား' ဆိုတာကို eval pack တစ်ခုနဲ့ ချက်ချင်း rerun လုပ်ကြည့်လို့ရပါတယ်။ Eval pack မရှိရင် ပြောင်းလိုက်တိုင်း manual စမ်းရမှာမို့ regression (ပြောင်းလိုက်လို့ ပျက်သွားတာ) ကို သတိမမူဘဲ ကျော်သွားနိုင်ပါတယ်။

အခြေအနေEval လို/မလို
Chat ထဲ တစ်ခါစမ်းကြည့်တာမလိုသေး
Prompt ကို production မှာ ပြန်သုံးမယ်လိုအပ်
Prompt/model ပြောင်းပြီးနောက်eval pack rerun လုပ်ရမည်

စတင်မယ်ဆိုရင်

Eval card ၅ ခုလောက်ကနေ စပါ — case အားလုံးအတွက် eval framework ကြီးကြီးမလိုသေးပါဘူး, spreadsheet တစ်ခုနဲ့တောင် စလို့ရပါတယ်။

အနှစ်ချုပ်

Eval ဆိုတာ AI ကို 'ယုံကြည်' ရုံနဲ့မဟုတ်ဘဲ 'သက်သေပြ' ရအောင် လုပ်ပေးတဲ့ practice ပါ။ Eval card လေးခုနဲ့ စပြီး prompt/context ပြောင်းတိုင်း rerun ကျင့်ထားရင် production မှာ regression ကို ကြိုတွေ့နိုင်ပါတယ်။

Sources

Related content