---
title: "Đo chất lượng model và ứng dụng AI"
description: "Khoá nền tảng về eval: đo chất lượng model và ứng dụng AI theo công việc cụ thể. Bạn học cách chọn metric, thiết kế case và dataset, kiểm tra AI judge và so sánh thay đổi để đề xuất có căn cứ."
canonical: "https://200lab.io/courses/do-chat-luong-model-va-ung-dung-ai"
type: "course"
course_type: "course"
learning_type: "free_form"
published: "2026-09-23T11:22:19Z"
students: 0
---

## Khoá học này mang lại gì cho bạn

- **Chọn** metric phù hợp với công việc cần đánh giá, đọc đúng mẫu số và chỉ ra loại lỗi mà điểm tổng đang che mất.
- **Phân biệt** lời Agent báo hoàn thành với trace và kết quả quan sát được, để biết bằng chứng hiện có xác nhận được điều gì.
- **Thiết kế** eval case và rubric đủ rõ để người khác chấm lại, kể cả khi có nhiều cách trả lời đúng hoặc chưa thống nhất được tiêu chuẩn.
- **Đánh giá** một dataset qua cách lấy mẫu, chia dữ liệu và sử dụng holdout, thay vì chỉ dựa vào số dòng hoặc điểm số cao.
- **Kiểm tra** AI judge bằng cách đối chiếu với reference đã được xem xét, tìm nhóm lỗi bị bỏ sót và xử lý bất đồng theo tiêu chí.
- **Đề xuất** nhận hay chưa nhận một thay đổi dựa trên so sánh từng case, kèm những điểm kém đi và giới hạn của kết luận.

Đây là khoá nền tảng về tư duy và phương pháp đánh giá AI, không phụ thuộc một model hay framework cụ thể.

## Khoá học cung cấp những nền tảng nào

Trục chính của khoá học là **eval**: đánh giá hành vi của hệ thống theo công việc, điều kiện và tiêu chí cụ thể. Tám bài, gồm bài mở đầu, hai bài nền dùng chung với Harness và năm bài chuyên sâu, nối việc đọc bằng chứng với việc tự thiết kế phép đo. Bạn đi từ câu hỏi “tốt cho việc gì?” tới cách giải thích vì sao một thay đổi đáng nhận, cần sửa thêm hoặc còn thiếu dữ liệu để quyết định.

### 1. Đọc bằng chứng trước khi tin kết quả

Hai bài nền Harness giúp bạn dựng lại đường đi quan sát được của một run: model đề xuất gì, tool trả về gì, state thay đổi ra sao và run dừng vì lý do nào. Từ đó, bạn phân biệt công việc cần đánh giá, từng lần thử, trace, kết quả trong môi trường và grader dùng để chấm. Một demo thành công có giá trị, nhưng cần thêm các case và những lần thử theo cùng tiêu chí để thấy hệ thống ứng xử khi điều kiện thay đổi. Qua ví dụ gửi đơn và hoá đơn, bạn học cách xác định bằng chứng còn thiếu; sang phần phân loại ticket, cùng thói quen ấy giúp bạn giữ rõ ranh giới giữa nhãn đúng và việc ticket đã thật sự được xử lý.

### 2. Chọn con số phản ánh đúng điều bạn cần

Một hệ thống gọi mọi ticket là “thường” vẫn có thể đạt accuracy 90% nếu phần lớn dữ liệu thuộc nhóm thường. Ví dụ này đưa bạn vào cách đọc tử số, mẫu số, recall theo nhóm và vai trò của baseline: mỗi phép tính đang trả lời câu hỏi nào, trên những trường hợp nào. Bạn tiếp tục xem ngưỡng quyết định thay đổi việc bỏ sót và báo nhầm ra sao, rồi đặt hai loại lỗi cạnh chi phí thực tế của công việc. Nhờ vậy, khi điểm tổng giảm mà khả năng nhận ra ticket khẩn tăng, bạn có cơ sở để bàn về sự đánh đổi thay vì loại bỏ thay đổi chỉ vì một con số đi xuống.

### 3. Viết case và tiêu chí chấm cho hành vi thật

Một eval case cần nói rõ input, context được phép dùng, hành vi mong đợi, lỗi không chấp nhận và cách kiểm tra. Bạn học cách tách đáp án khỏi phần model nhận được, kiểm tra nhãn bằng code khi phù hợp và dùng rubric mô tả hành vi cho những câu trả lời có nhiều cách diễn đạt đúng. Các ticket thiếu thông tin cho thấy vì sao hỏi lại có thể là câu trả lời đúng, còn JSON đúng định dạng vẫn có thể chứa quyết định sai. Bài học cũng tách sự mơ hồ của input khỏi chỗ chưa thống nhất trong policy, để những case chưa chấm được vẫn được ghi nhận cùng lý do thay vì biến mất khỏi báo cáo.

### 4. Hiểu dataset đại diện cho những trường hợp nào

Một nghìn dòng dữ liệu có thể chỉ là nhiều phiên bản của một số ít sự cố; xáo trộn theo dòng dễ khiến cùng một chuyện xuất hiện ở cả tập chỉnh sửa lẫn tập đánh giá. Bạn học cách chọn đơn vị chia theo nhóm hoặc thời gian dựa trên điều muốn kiểm chứng, và vì sao holdout mất tính độc lập khi được dùng để chỉnh prompt hay chọn phương án. Khoá học phân biệt tập phản ánh dữ liệu dự kiến với tập cố tình gom ca khó, đồng thời hướng dẫn đọc kết quả theo nhóm kèm mẫu số. Các ví dụ về cỡ mẫu và khoảng tin cậy giúp bạn thấy độ bất định do lấy mẫu khác với biến động giữa các lần chạy model hay sự thay đổi của dữ liệu trong tương lai.

### 5. Kiểm tra chính người và AI đang chấm

Khi người chấm và AI judge không đồng ý, khoá học hướng bạn quay lại output, rubric và bằng chứng nghiệp vụ để xem bên nào có căn cứ. Bạn học vì sao mức đồng ý cao vẫn che được nhiều lỗi, vì sao hai cột điểm cùng tăng chưa chắc cho cùng kết quả, và tại sao cần xem cả một số case mà hai bên đã đồng ý. Phần xử lý bất đồng chỉ rõ lúc nào có thể chốt nhãn, lúc nào cần người phụ trách nghiệp vụ quyết định policy, và lúc nào nên giữ trạng thái unresolved. Từ đó, bạn hiểu cách chỉnh rubric hoặc hướng dẫn cho judge trên tập dev rồi kiểm lại trên dữ liệu chưa dùng để chỉnh, giữ riêng nhãn gốc và phiên bản tiêu chí để các con số còn so sánh được.

### 6. So sánh thay đổi và viết đề xuất có căn cứ

Bài cuối đặt hai phiên bản cạnh nhau trên cùng các case và điều kiện đánh giá đã chốt, giúp bạn thấy bản mới sửa được lỗi nào và làm hỏng trường hợp nào vốn đang đúng. Bạn đọc bảng paired evaluation theo từng nhóm để nhận ra regression nằm ở đâu, kể cả khi điểm tổng tăng. Ví dụ cũng chỉ ra rằng mẫu nhỏ hạn chế kết luận về toàn bộ dữ liệu, nhưng không xoá đi một lỗi đã quan sát rõ trên case cụ thể. Phần decision note kết nối mục tiêu, phiên bản, kết quả, tiêu chí đặt trước và những điều chưa biết thành một đề xuất người khác có thể kiểm lại; quyết định release vẫn thuộc người có trách nhiệm với sản phẩm.

## Vì sao 200Lab tạo ra khoá học này

Việc thử một model mới hay sửa prompt ngày càng thuận tiện. Chỉ qua vài lượt thử, bạn có thể có những output đủ thuyết phục để mang vào buổi review. Khi phải chọn phiên bản cho một tính năng thật, câu hỏi khó hơn xuất hiện: kết quả ấy có tốt cho công việc của bạn, và phép thử đã bao quát được những trường hợp quan trọng chưa?

Cái bẫy dễ gặp là để phần dễ nhìn quyết định thay phần cần đo. Câu trả lời trôi chảy, bảng điểm tăng hay một demo thành công đều tạo cảm giác yên tâm. Trong khi đó, một nhóm lỗi ít xuất hiện nhưng gây hậu quả lớn có thể vẫn nằm ngoài cuộc thảo luận.

200Lab phát triển các hệ thống AI như GoClaw, AgentBrain và Emree. Công việc xây hệ thống đặt ra nhu cầu phân biệt năng lực của model với hành vi của ứng dụng khi có thêm tool, context và state. Từ mối quan tâm đó, 200Lab xây khoá học để bạn có phương pháp xem xét kết quả, đặt câu hỏi với phép chấm và đưa ra đề xuất rõ lý do. Bạn có thể bắt đầu từ một báo cáo nhỏ, miễn là nói đúng điều đã đo và điều còn chưa biết.

## Những vấn đề thường gặp khi đánh giá AI

Khi kết quả chưa như mong muốn, đổi model hoặc sửa prompt thường là phản xạ đầu tiên. Nhưng nguyên nhân cũng có thể nằm ở cách chọn case, cách chấm hay cách đọc báo cáo. Những dấu hiệu dưới đây giúp bạn biết nên kiểm tra phần nào trước:

- Accuracy cao nhưng ticket khẩn vẫn bị bỏ sót — dùng điểm tổng làm bằng chứng rằng hệ thống đã làm tốt mục tiêu quan trọng nhất.
- Output đúng JSON nhưng chọn sai priority — coi việc qua kiểm tra định dạng là đã qua kiểm tra quyết định.
- Holdout tăng điểm sau mỗi lượt sửa prompt — tiếp tục xem tập đã dùng để chỉnh là phép đo độc lập trên dữ liệu mới.
- Dataset nhiều dòng nhưng kết luận vẫn yếu — đếm các ticket gần trùng của cùng một sự cố như những bằng chứng độc lập.
- Judge đồng ý với người chấm ở đa số case — bỏ qua khả năng cả hai cùng sai hoặc judge yếu đúng ở nhóm lỗi cần bắt.
- Bản mới tăng điểm nhưng làm hỏng case quan trọng — chấp nhận thay đổi theo mức tăng trung bình mà chưa đọc regression theo nhóm.

Mỗi vấn đề được phân tích bằng ví dụ và cách kiểm tra cụ thể trong các bài học.

## Bạn sẽ học theo cách nào

- **Theo tình huống cụ thể.** Ví dụ Agent gửi đơn, gửi hoá đơn và phân loại ticket giúp bạn nối tiêu chí với kết quả quan sát được.
- **Đọc bảng số và ảnh minh hoạ.** Các phép đếm, bảng so sánh và ảnh tĩnh làm rõ nơi điểm số dễ gây hiểu nhầm.
- **Học nối từ nền Harness.** Hai bài nền đã có trong tám bài của AI14; mua AI14 không cần mua thêm Harness để xem chúng. Nếu đã học, bạn có thể ôn nhanh rồi đi tiếp.

## Khoá học dành cho ai

1. **Developer đang xây hoặc đánh giá ứng dụng AI — phù hợp nhất.** Bạn quen input, output và test, muốn biết cách kiểm chứng một thay đổi prompt hay model.
2. **QA, technical lead và người phụ trách sản phẩm có nền kỹ thuật.** Bạn cần đọc báo cáo eval và trao đổi với đội phát triển về tiêu chí chấp nhận thay đổi.
3. **Người đã học nền Agent Harness.** Bạn muốn đi tiếp từ đọc trace và bằng chứng sang thiết kế case, dataset và phép so sánh.

## Những điều cần lưu ý

- Khoá học không yêu cầu ML training, GPU hay provider API; bạn học phương pháp qua ví dụ và dữ liệu được trình bày sẵn.
- Phần nền Harness cần sự quen thuộc với Agent, model, tool, call/result, state và điều kiện dừng; đây là lộ trình học tiếp cho người có nền tương ứng.
- Đây là khoá lý thuyết ứng dụng, không có lab chạy provider hay cam kết chất lượng production; bạn nhận được cách thiết kế và đọc phép đánh giá có giới hạn rõ ràng.

## Bắt đầu từ đâu

Bắt đầu với bài mở đầu “Nhìn ổn rồi — nhưng ổn cho việc gì?”. Câu hỏi này giúp bạn xác định mục tiêu trước khi chọn metric hay cách chấm. Từ đó, bạn xem phần nền mình cần và đi tiếp vào các phép đo cụ thể.

## Chương trình

- Nhìn ổn rồi — nhưng ổn cho việc gì? (miễn phí)
- Muốn sửa Agent, hãy dựng lại đường đi của run · quiz
- Demo chạy đúng rồi, nhưng Agent đã ổn định chưa? · quiz
- Accuracy 90% mà không bắt được ticket khẩn nào (miễn phí) · quiz
- Viết eval case sao cho phép chấm không tự đánh lừa mình · quiz
- Một nghìn dòng test có nói được chuyện ngoài đời không? · quiz
- Khi người chấm và AI judge không đồng ý · quiz
- Điểm tổng tăng rồi, đã đủ để nhận thay đổi chưa? · quiz
