Thuta Learning
ရှာဖွေရန်
AdvancedAIadvanced

Advanced Production Observability and Evaluation

စိတ်လျှော့ပါ။ ဒီခန်းကို စာအုပ်လိုမဟုတ်ဘဲ စကားပြောသလိုပဲ၊ နားလည်လွယ်အောင် ရှင်းပါမယ်။

ဒီခန်းပြီးရင် ဘာတတ်သွားမလဲ

  • Tracing အရေးပါမှုကိုနားလည်ရန်
  • Evaluation case တည်ဆောက်ရန်
  • Regression ကိုစစ်ရန်

ရိုးရိုးလေး ရှင်းပြမယ်

LLM app ကို output တစ်ခုပဲကြည့်၍စိတ်ချမရပါ။ Prompt, model နှင့် tool call တစ်ဆင့်ချင်းကို trace လုပ်ပြီး expected tool sequence, grounded answer နှင့် latency ကဲ့သို့အချက်များကို dataset ပေါ်တွင်စစ်ပါ။ Sensitive data ကို metadata ထဲမပို့ခင်ဖယ်ရှားပါ။

python
test_cases = [
    {
        "input": "ရန်ကုန်အတွက် မိုးလေဝသကိုရှာပါ",
        "expected_tool": "get_weather",
        "must_include": "ရန်ကုန်",
    }
]

for case in test_cases:
    result = agent.invoke({
        "messages": [{"role": "user", "content": case["input"]}]
    })
    assert result["messages"], "Agent returned no messages"
    print("Evaluation case completed")
You should see
Evaluation case completed

လက်တွေ့စမ်းကြည့်ရန်

မိမိ agent အတွက် normal, ambiguous နှင့် unsafe inputs ပါသော evaluation cases အနည်းဆုံး 10 ခုရေးပါ။

LangSmith ObservabilityLangChain

ဒီနေရာမှာ လူအများမှားတတ်တယ်

  • Happy path တစ်ခုတည်းဖြင့်စမ်းခြင်း
  • Trace metadata ထဲ sensitive user data ထည့်ခြင်း
  • Prompt ပြောင်းပြီး regression evaluation မလုပ်ခြင်း

လေ့ကျင့်ခန်း

မိမိ agent အတွက် normal, ambiguous နှင့် unsafe inputs ပါသော evaluation cases အနည်းဆုံး 10 ခုရေးပါ။

You'll know it worked when: Evaluation case completed

Advanced Production Observability and Evaluation | Thuta Learning