Prompt injection là tình huống dữ liệu đầu vào tìm cách thay đổi chỉ dẫn hoặc quyền của AI Skill. Nội dung nguy hiểm có thể nằm trong tin nhắn, tệp, trang web, kết quả tìm kiếm hoặc dữ liệu do Skill khác chuyển sang.

Prompt injection trong AI Skill là gì?

Prompt injection xảy ra khi nội dung được đọc như dữ liệu nhưng lại được AI diễn giải như mệnh lệnh. Vấn đề liên quan tới câu chữ, quyền công cụ và cách Skill ghép context.

Vì sao Skill dễ bị injection?

Rủi ro tăng khi Skill trộn instruction, yêu cầu người dùng và nội dung truy xuất; khi công cụ có quyền rộng; hoặc khi handoff không có schema.

Bốn lớp phòng thủ thực tế

Phân tách chỉ dẫn và dữ liệu; giới hạn quyền công cụ; xác thực đầu ra trước khi hành động; giữ provenance và log an toàn.

Cách cô lập dữ liệu không đáng tin

Mỗi nguồn có mức tin cậy và phạm vi sử dụng. Nội dung web, tệp tải lên và kết quả tìm kiếm chỉ là tham khảo cho đến khi được xác minh. Handoff chỉ chuyển trường đã lọc theo schema.

Bộ test prompt injection tối thiểu

Kiểm thử yêu cầu bỏ qua quy tắc, giả mạo vai trò hệ thống, tiết lộ secret, chèn lệnh trong tệp, qua kết quả tìm kiếm và ở bước handoff. Mỗi ca cần đầu vào, quyền được phép, đầu ra mong đợi và hành động bị chặn.

Checklist trước khi triển khai

Tách dữ liệu khỏi instruction; quyền công cụ tối thiểu; output contract chặn hành động bất thường; handoff dùng schema; có NEEDS_REVIEW; log không chứa secret; đã chạy test injection trực tiếp và gián tiếp.

Có thể loại bỏ hoàn toàn prompt injection không?

Không thể đảm bảo tuyệt đối. Mục tiêu là giảm bề mặt tấn công, giới hạn tác động và phát hiện sớm.

Khi phát hiện injection, Skill nên làm gì?

Dừng hành động nhạy cảm, trả trạng thái rõ ràng, lưu dấu vết an toàn và yêu cầu nguồn sạch hơn.

Chống prompt injection là bài toán kiến trúc. Khi tách instruction khỏi dữ liệu, giới hạn quyền công cụ, xác thực output và kiểm thử nhiều đường tấn công, AI Skill sẽ an toàn hơn. Kết hợp guardrails AI Skill và error handling AI Skill.