Bỏ qua điều hướng
200Lab
Khóa họcHarness

Đo chất lượng model và ứng dụng AI

AI Evaluation: Metrics, Datasets, Graders & Decision-Making

Khoá nền tảng về eval: đo chất lượng model và ứng dụng AI theo công việc cụ thể. Bạn học cách chọn metric, thiết kế case và dataset, kiểm tra AI judge và so sánh thay đổi để đề xuất có căn cứ.

  • 8bài
  • 2h15pthời lượng
  • 7quiz
  • Lead
    Việt Trần

    AI Solution Architect & Founder 200Lab

    Hơn 15 năm Solution Architect, chuyên làm giải pháp cho các hệ thống tải cao và AI Agent/Harness System ở cấp độ doanh nghiệp. Tác giả skill UI UX Pro Max (hơn 120k stars trên Github), GoClaw, Emree, AgentBrains.

Bạn sẽ làm được gì

  • Chọnmetric phù hợp với công việc cần đánh giá, đọc đúng mẫu số và chỉ ra loại lỗi mà điểm tổng đang che mất.
  • Phân biệtlời Agent báo hoàn thành với trace và kết quả quan sát được, để biết bằng chứng hiện có xác nhận được điều gì.
  • Thiết kếeval case và rubric đủ rõ để người khác chấm lại, kể cả khi có nhiều cách trả lời đúng hoặc chưa thống nhất được tiêu chuẩn.
  • Đánh giámột dataset qua cách lấy mẫu, chia dữ liệu và sử dụng holdout, thay vì chỉ dựa vào số dòng hoặc điểm số cao.
  • Kiểm traAI judge bằng cách đối chiếu với reference đã được xem xét, tìm nhóm lỗi bị bỏ sót và xử lý bất đồng theo tiêu chí.
  • Đề xuấtnhận hay chưa nhận một thay đổi dựa trên so sánh từng case, kèm những điểm kém đi và giới hạn của kết luận.

Đây là khoá nền tảng về tư duy và phương pháp đánh giá AI, không phụ thuộc một model hay framework cụ thể.

Chủ đềAgentMarkdown

Cách học và dành cho ai

Khoá học dành cho ai

  1. Developer đang xây hoặc đánh giá ứng dụng AI — phù hợp nhất.Phù hợp nhấtBạn quen input, output và test, muốn biết cách kiểm chứng một thay đổi prompt hay model.
  2. QA, technical lead và người phụ trách sản phẩm có nền kỹ thuật.Bạn cần đọc báo cáo eval và trao đổi với đội phát triển về tiêu chí chấp nhận thay đổi.
  3. Người đã học nền Agent Harness.Bạn muốn đi tiếp từ đọc trace và bằng chứng sang thiết kế case, dataset và phép so sánh.

Bạn sẽ học theo cách nào

  • Theo tình huống cụ thể.Ví dụ Agent gửi đơn, gửi hoá đơn và phân loại ticket giúp bạn nối tiêu chí với kết quả quan sát được.
  • Đọc bảng số và ảnh minh hoạ.Các phép đếm, bảng so sánh và ảnh tĩnh làm rõ nơi điểm số dễ gây hiểu nhầm.
  • Học nối từ nền Harness.Hai bài nền đã có trong tám bài của AI14; mua AI14 không cần mua thêm Harness để xem chúng. Nếu đã học, bạn có thể ôn nhanh rồi đi tiếp.

Những điều cần lưu ý

  • Khoá học không yêu cầu ML training, GPU hay provider API; bạn học phương pháp qua ví dụ và dữ liệu được trình bày sẵn.
  • Phần nền Harness cần sự quen thuộc với Agent, model, tool, call/result, state và điều kiện dừng; đây là lộ trình học tiếp cho người có nền tương ứng.
  • Đây là khoá lý thuyết ứng dụng, không có lab chạy provider hay cam kết chất lượng production; bạn nhận được cách thiết kế và đọc phép đánh giá có giới hạn rõ ràng.

Mentor

  • Việt TrầnLead mentor

    AI Solution Architect & Founder 200Lab

    Hơn 15 năm Solution Architect, chuyên làm giải pháp cho các hệ thống tải cao và AI Agent/Harness System ở cấp độ doanh nghiệp. Tác giả skill UI UX Pro Max (hơn 120k stars trên Github), GoClaw, Emree, AgentBrains.

Bắt đầu từ đâu

Bắt đầu với bài mở đầu “Nhìn ổn rồi — nhưng ổn cho việc gì?”. Câu hỏi này giúp bạn xác định mục tiêu trước khi chọn metric hay cách chấm. Từ đó, bạn xem phần nền mình cần và đi tiếp vào các phép đo cụ thể.

Học thử bài đầu tiên

Khoá học dạy những gì

Trục chính của khoá học là eval: đánh giá hành vi của hệ thống theo công việc, điều kiện và tiêu chí cụ thể. Tám bài, gồm bài mở đầu, hai bài nền dùng chung với Harness và năm bài chuyên sâu, nối việc đọc bằng chứng với việc tự thiết kế phép đo. Bạn đi từ câu hỏi “tốt cho việc gì?” tới cách giải thích vì sao một thay đổi đáng nhận, cần sửa thêm hoặc còn thiếu dữ liệu để quyết định.

  1. Đọc bằng chứng trước khi tin kết quả

    Hai bài nền Harness giúp bạn dựng lại đường đi quan sát được của một run: model đề xuất gì, tool trả về gì, state thay đổi ra sao và run dừng vì lý do nào. Từ đó, bạn phân biệt công việc cần đánh giá, từng lần thử, trace, kết quả trong môi trường và grader dùng để chấm. Một demo thành công có giá trị, nhưng cần thêm các case và những lần thử theo cùng tiêu chí để thấy hệ thống ứng xử khi điều kiện thay đổi. Qua ví dụ gửi đơn và hoá đơn, bạn học cách xác định bằng chứng còn thiếu; sang phần phân loại ticket, cùng thói quen ấy giúp bạn giữ rõ ranh giới giữa nhãn đúng và việc ticket đã thật sự được xử lý.

  2. Chọn con số phản ánh đúng điều bạn cần

    Một hệ thống gọi mọi ticket là “thường” vẫn có thể đạt accuracy 90% nếu phần lớn dữ liệu thuộc nhóm thường. Ví dụ này đưa bạn vào cách đọc tử số, mẫu số, recall theo nhóm và vai trò của baseline: mỗi phép tính đang trả lời câu hỏi nào, trên những trường hợp nào. Bạn tiếp tục xem ngưỡng quyết định thay đổi việc bỏ sót và báo nhầm ra sao, rồi đặt hai loại lỗi cạnh chi phí thực tế của công việc. Nhờ vậy, khi điểm tổng giảm mà khả năng nhận ra ticket khẩn tăng, bạn có cơ sở để bàn về sự đánh đổi thay vì loại bỏ thay đổi chỉ vì một con số đi xuống.

  3. Viết case và tiêu chí chấm cho hành vi thật

    Một eval case cần nói rõ input, context được phép dùng, hành vi mong đợi, lỗi không chấp nhận và cách kiểm tra. Bạn học cách tách đáp án khỏi phần model nhận được, kiểm tra nhãn bằng code khi phù hợp và dùng rubric mô tả hành vi cho những câu trả lời có nhiều cách diễn đạt đúng. Các ticket thiếu thông tin cho thấy vì sao hỏi lại có thể là câu trả lời đúng, còn JSON đúng định dạng vẫn có thể chứa quyết định sai. Bài học cũng tách sự mơ hồ của input khỏi chỗ chưa thống nhất trong policy, để những case chưa chấm được vẫn được ghi nhận cùng lý do thay vì biến mất khỏi báo cáo.

  4. Hiểu dataset đại diện cho những trường hợp nào

    Một nghìn dòng dữ liệu có thể chỉ là nhiều phiên bản của một số ít sự cố; xáo trộn theo dòng dễ khiến cùng một chuyện xuất hiện ở cả tập chỉnh sửa lẫn tập đánh giá. Bạn học cách chọn đơn vị chia theo nhóm hoặc thời gian dựa trên điều muốn kiểm chứng, và vì sao holdout mất tính độc lập khi được dùng để chỉnh prompt hay chọn phương án. Khoá học phân biệt tập phản ánh dữ liệu dự kiến với tập cố tình gom ca khó, đồng thời hướng dẫn đọc kết quả theo nhóm kèm mẫu số. Các ví dụ về cỡ mẫu và khoảng tin cậy giúp bạn thấy độ bất định do lấy mẫu khác với biến động giữa các lần chạy model hay sự thay đổi của dữ liệu trong tương lai.

  5. Kiểm tra chính người và AI đang chấm

    Khi người chấm và AI judge không đồng ý, khoá học hướng bạn quay lại output, rubric và bằng chứng nghiệp vụ để xem bên nào có căn cứ. Bạn học vì sao mức đồng ý cao vẫn che được nhiều lỗi, vì sao hai cột điểm cùng tăng chưa chắc cho cùng kết quả, và tại sao cần xem cả một số case mà hai bên đã đồng ý. Phần xử lý bất đồng chỉ rõ lúc nào có thể chốt nhãn, lúc nào cần người phụ trách nghiệp vụ quyết định policy, và lúc nào nên giữ trạng thái unresolved. Từ đó, bạn hiểu cách chỉnh rubric hoặc hướng dẫn cho judge trên tập dev rồi kiểm lại trên dữ liệu chưa dùng để chỉnh, giữ riêng nhãn gốc và phiên bản tiêu chí để các con số còn so sánh được.

  6. So sánh thay đổi và viết đề xuất có căn cứ

    Bài cuối đặt hai phiên bản cạnh nhau trên cùng các case và điều kiện đánh giá đã chốt, giúp bạn thấy bản mới sửa được lỗi nào và làm hỏng trường hợp nào vốn đang đúng. Bạn đọc bảng paired evaluation theo từng nhóm để nhận ra regression nằm ở đâu, kể cả khi điểm tổng tăng. Ví dụ cũng chỉ ra rằng mẫu nhỏ hạn chế kết luận về toàn bộ dữ liệu, nhưng không xoá đi một lỗi đã quan sát rõ trên case cụ thể. Phần decision note kết nối mục tiêu, phiên bản, kết quả, tiêu chí đặt trước và những điều chưa biết thành một đề xuất người khác có thể kiểm lại; quyết định release vẫn thuộc người có trách nhiệm với sản phẩm.

Nội dung khóa học

8 bài · 7 quiz
  1. Nhìn ổn rồi — nhưng ổn cho việc gì?Mở đầu khóa AI evaluation: demo, task, evidence và quyết địnhtext · 13 phút · Không tính tiến độCần đăng nhập
  2. Muốn sửa Agent, hãy dựng lại đường đi của runTrace, span, event ledger, state transition, stop reasontext · 15 phút · có quizCần đăng nhập
  3. Demo chạy đúng rồi, nhưng Agent đã ổn định chưa?Task, trial, trace, environment outcome, grader, repeatable evaluationtext · 16 phút · có quizCần đăng nhập
  4. Accuracy 90% mà không bắt được ticket khẩn nàoAccuracy, recall theo nhóm, denominator, decision threshold và chi phí lỗitext · 15 phút · có quizCần đăng nhập
  5. Viết eval case sao cho phép chấm không tự đánh lừa mìnhEval case, rubric, chọn grader và data leakage trong phép chấmtext · 18 phút · có quizCần đăng nhập
  6. Một nghìn dòng test có nói được chuyện ngoài đời không?Evaluation dataset, holdout split, contamination, sampling và uncertaintytext · 17 phút · có quizCần đăng nhập
  7. Khi người chấm và AI judge không đồng ýHuman adjudication, judge agreement, error slices và calibrationtext · 24 phút · có quizCần đăng nhập
  8. Điểm tổng tăng rồi, đã đủ để nhận thay đổi chưa?Paired evaluation, regression analysis và evidence-based decision notetext · 16 phút · có quizCần đăng nhập

Vì sao có khoá học này

Việc thử một model mới hay sửa prompt ngày càng thuận tiện. Chỉ qua vài lượt thử, bạn có thể có những output đủ thuyết phục để mang vào buổi review. Khi phải chọn phiên bản cho một tính năng thật, câu hỏi khó hơn xuất hiện: kết quả ấy có tốt cho công việc của bạn, và phép thử đã bao quát được những trường hợp quan trọng chưa?

Cái bẫy dễ gặp là để phần dễ nhìn quyết định thay phần cần đo. Câu trả lời trôi chảy, bảng điểm tăng hay một demo thành công đều tạo cảm giác yên tâm. Trong khi đó, một nhóm lỗi ít xuất hiện nhưng gây hậu quả lớn có thể vẫn nằm ngoài cuộc thảo luận.

200Lab phát triển các hệ thống AI như GoClaw, AgentBrain và Emree. Công việc xây hệ thống đặt ra nhu cầu phân biệt năng lực của model với hành vi của ứng dụng khi có thêm tool, context và state. Từ mối quan tâm đó, 200Lab xây khoá học để bạn có phương pháp xem xét kết quả, đặt câu hỏi với phép chấm và đưa ra đề xuất rõ lý do. Bạn có thể bắt đầu từ một báo cáo nhỏ, miễn là nói đúng điều đã đo và điều còn chưa biết.

Những vấn đề thường gặp khi đánh giá AI

Khi kết quả chưa như mong muốn, đổi model hoặc sửa prompt thường là phản xạ đầu tiên. Nhưng nguyên nhân cũng có thể nằm ở cách chọn case, cách chấm hay cách đọc báo cáo. Những dấu hiệu dưới đây giúp bạn biết nên kiểm tra phần nào trước:

  • Dấu hiệu: Accuracy cao nhưng ticket khẩn vẫn bị bỏ sótThực ra: dùng điểm tổng làm bằng chứng rằng hệ thống đã làm tốt mục tiêu quan trọng nhất.
  • Dấu hiệu: Output đúng JSON nhưng chọn sai priorityThực ra: coi việc qua kiểm tra định dạng là đã qua kiểm tra quyết định.
  • Dấu hiệu: Holdout tăng điểm sau mỗi lượt sửa promptThực ra: tiếp tục xem tập đã dùng để chỉnh là phép đo độc lập trên dữ liệu mới.
  • Dấu hiệu: Dataset nhiều dòng nhưng kết luận vẫn yếuThực ra: đếm các ticket gần trùng của cùng một sự cố như những bằng chứng độc lập.
  • Dấu hiệu: Judge đồng ý với người chấm ở đa số caseThực ra: bỏ qua khả năng cả hai cùng sai hoặc judge yếu đúng ở nhóm lỗi cần bắt.
  • Dấu hiệu: Bản mới tăng điểm nhưng làm hỏng case quan trọngThực ra: chấp nhận thay đổi theo mức tăng trung bình mà chưa đọc regression theo nhóm.

Mỗi vấn đề được phân tích bằng ví dụ và cách kiểm tra cụ thể trong các bài học.

Câu hỏi thường gặp

Mình thanh toán bằng cách nào?

Bạn thanh toán bằng chuyển khoản ngân hàng qua mã VietQR ở bước checkout. 200Lab không thu thập thông tin thẻ của bạn.

Thanh toán xong bao lâu thì vào học được?

Hệ thống tự đối soát giao dịch, thường trong vài phút là khoá học có trong trang học của bạn. Bạn nhớ giữ nguyên nội dung chuyển khoản mà hệ thống đưa ra.

Mã QR hết hạn thì sao?

Mỗi đơn hàng có hiệu lực 30 phút. Nếu quá thời gian đó, bạn mở lại đơn và tạo mã QR mới, không cần đặt lại từ đầu.

Mình được truy cập khoá học trong bao lâu?

Thời hạn truy cập đi theo gói bạn mua và được ghi ngay dưới giá ở hộp mua.

Mình có nhận được các cập nhật của khoá học sau khi mua không?

Có. Khi khoá học được bổ sung hoặc cập nhật bài học, bạn nhận được các thay đổi đó trong suốt thời hạn truy cập của mình, không phải trả thêm.

Mình học trên điện thoại được không?

Được. 200Lab chạy trên trình duyệt của cả máy tính lẫn điện thoại, bạn không cần cài ứng dụng. Tiến độ học được lưu theo tài khoản nên bạn đổi thiết bị vẫn học tiếp được.

Học xong mình có nhận certificate không?

Có. Khi hoàn thành khoá học bạn nhận certificate có mã xác thực. Người khác có thể kiểm tra mã đó trên trang xác thực certificate của 200Lab nếu bạn chọn công khai.

Mình có thể học thử trước khi mua không?

Có. Khoá học này có bài học thử: bạn bấm nút Học thử ngay trong hộp mua, và các bài đó được đánh dấu trong chương trình học.