TRAINING AI

ENGINEER / TRACE BEFORE GUESSING

Đừng debug AI bằng cảm giác.

Khi AI đã nằm trong một hệ thống, output xấu có thể đến từ retrieval, permission, tool call, latency, grader hoặc infra. Engineer giúp bạn lần theo request path và biết nên đo gì trước.

Chọn lớp cần kiểm ↓

DIAGNOSTIC MAP

Bắt đầu từ symptom. Đo đúng lớp trước.

QUALITY / EVALS

Khi nhìn vào đây: output tụt sau khi đổi model, prompt hoặc tool. Failure thường là task set không đại diện hoặc grader mơ hồ.

Đo trước: representative task set, pass/fail criteria, failure taxonomy và regression theo phiên bản.

RETRIEVAL / RAG

Khi nhìn vào đây: câu trả lời nghe hợp lý nhưng bỏ sót context hoặc kéo sai tài liệu.

Đo trước: query set, relevance judgment, missing-context failures, reranking impact. Tách retrieval quality khỏi answer quality.

PERMISSIONS

Khi nhìn vào đây: agent gọi tool, đọc dữ liệu hoặc có thể thực hiện hành động rủi ro.

Đo trước: tool permissions, protected-data boundary, human approval points và audit trail.
OWASP GenAI ↗ · NIST GenAI Profile ↗

LATENCY

Khi nhìn vào đây: app chậm dù model benchmark nhìn rất nhanh. Vendor throughput không phải app latency.

Đo trước: network, queue, TTFT, generation, tool execution và retries trong trace end-to-end.

INFRA / COST

Khi nhìn vào đây: bạn chịu SLA, throughput, memory hoặc cost trong production workload.

Đo trước: workload shape, latency target, throughput, memory, batching và failure budget trước khi chọn serving trade-off.