QUALITY / EVALS
Khi nhìn vào đây: output tụt sau khi đổi model, prompt hoặc tool. Failure thường là task set không đại diện hoặc grader mơ hồ.
Đo trước: representative task set, pass/fail criteria, failure taxonomy và regression theo phiên bản.
ENGINEER / TRACE BEFORE GUESSING
Khi AI đã nằm trong một hệ thống, output xấu có thể đến từ retrieval, permission, tool call, latency, grader hoặc infra. Engineer giúp bạn lần theo request path và biết nên đo gì trước.
DIAGNOSTIC MAP
Khi nhìn vào đây: output tụt sau khi đổi model, prompt hoặc tool. Failure thường là task set không đại diện hoặc grader mơ hồ.
Đo trước: representative task set, pass/fail criteria, failure taxonomy và regression theo phiên bản.
Khi nhìn vào đây: câu trả lời nghe hợp lý nhưng bỏ sót context hoặc kéo sai tài liệu.
Đo trước: query set, relevance judgment, missing-context failures, reranking impact. Tách retrieval quality khỏi answer quality.
Khi nhìn vào đây: agent gọi tool, đọc dữ liệu hoặc có thể thực hiện hành động rủi ro.
Đo trước: tool permissions, protected-data boundary, human approval points và audit trail.
OWASP GenAI ↗ · NIST GenAI Profile ↗
Khi nhìn vào đây: app chậm dù model benchmark nhìn rất nhanh. Vendor throughput không phải app latency.
Đo trước: network, queue, TTFT, generation, tool execution và retries trong trace end-to-end.
Khi nhìn vào đây: bạn chịu SLA, throughput, memory hoặc cost trong production workload.
Đo trước: workload shape, latency target, throughput, memory, batching và failure budget trước khi chọn serving trade-off.