AI Skill không nên được đánh giá chỉ bằng cảm giác “trả lời nghe có vẻ đúng”. Đo lường chất lượng AI Skill là cách biến mục tiêu thành tiêu chí kiểm tra, theo dõi lỗi kích hoạt, độ đầy đủ của output và khả năng giữ ổn định sau mỗi lần cập nhật.

Đo lường chất lượng AI Skill là gì?

Đó là quy trình thu thập cùng một nhóm tín hiệu qua nhiều lần chạy: Skill có được chọn đúng không, output có đủ trường không, nguồn có được giữ không và người dùng có phải sửa lại nhiều không. Mục tiêu là phát hiện xu hướng và lỗi có thể tái hiện.

Năm nhóm chỉ số nên theo dõi

Theo dõi routing accuracy, output completeness, factual and source fidelity, consistency across runs và user correction rate. Mỗi nhóm phản ánh một rủi ro khác nhau từ định tuyến đến trải nghiệm thực tế.

Tạo bộ đánh giá có thể lặp lại

Bộ đánh giá nên có direct match, negative control, overlap, missing source, edge case và regression case. Mỗi ca cần input, phiên bản Skill, kết quả mong đợi, kết quả thực tế và quyết định đạt hay chưa đạt.

Chấm điểm có trọng số hay đạt/không đạt?

Đạt/không đạt phù hợp với trường bắt buộc, canonical, trạng thái và link. Chấm điểm có trọng số phù hợp với độ rõ, độ tự nhiên hoặc mức hữu ích. Hãy xác định blocker không được bù bằng điểm cao ở tiêu chí khác.

Thiết kế ngưỡng phát hành

Chỉ phát hành khi không có lỗi blocker, trường bắt buộc đạt, routing không phát sinh lỗi nghiêm trọng và ca hồi quy quan trọng vẫn ổn định. Ngưỡng cụ thể phụ thuộc workflow, không có một tỷ lệ chung cho mọi Skill.

Theo dõi sau triển khai

Tiếp tục lưu input đại diện, status, lỗi và yêu cầu người dùng sửa lại. Nếu lỗi xuất hiện lặp lại, thêm nó vào regression suite trước khi chỉnh rule.

Quy trình cải tiến theo vòng lặp

Chọn mục tiêu, thu thập ca kiểm thử, phân loại lỗi, sửa đúng lớp gây lỗi, chạy lại bộ test cố định và ca mới, rồi ghi changelog và quyết định phát hành.

Checklist đánh giá trước khi phát hành

Có direct, negative, overlap, missing và edge test; mỗi ca có bằng chứng; output contract và link được xác nhận; lỗi blocker có quy tắc dừng hoặc rollback; ca lỗi mới đã thêm vào regression suite.

Có nên đánh giá AI Skill bằng một điểm số duy nhất không?

Không nên. Một điểm số có thể che khuất lỗi blocker như thiếu nguồn hoặc sai routing. Hãy tách chỉ số cứng, tiêu chí mềm và lỗi không được phép.

Bao nhiêu ca kiểm thử là đủ?

Không có con số cố định. Bộ test cần bao phủ các nhánh quan trọng, đặc biệt là negative control, overlap, thiếu nguồn và lỗi thực tế.

Khi thay đổi description có cần đo lại toàn bộ không?

Có. Description ảnh hưởng định tuyến nên có thể làm thay đổi Skill được chọn dù instructions không đổi.

Đo lường chất lượng AI Skill hiệu quả khi tiêu chí gắn với lỗi có thể quan sát và tái hiện. Hãy kết hợp routing accuracy, output completeness, source fidelity, consistency và user correction rate với bộ test cố định. Đọc thêm bộ test hồi quy, versioning AI Skill và router AI Skill.