1. Tóm tắt nhanh & màn hình bạn sẽ test
Chào bạn! Nếu app bạn đang test có thêm một trợ lý AI (chatbot) để trả lời khách hàng, công việc của tester không dừng ở việc bấm nút xem giao diện có đúng không. Câu hỏi lớn hơn là: câu trả lời của AI có ĐÚNG không, có LẤY TỪ nguồn dữ liệu thật không, và nó có bị kẻ xấu 'lừa' để làm điều không được phép không? Đây là một mảng kiểm thử khá mới nhưng ngày càng quan trọng khi các app SaaS đua nhau tích hợp AI. Chúng ta sẽ học qua app CloudDesk thật, có hình minh hoạ và ví dụ prompt cụ thể.
2. Kiến trúc chatbot AI và đặc thù kiểm thử
Đa số chatbot AI trong SaaS hiện nay không chỉ 'hỏi thẳng' mô hình LLM mà dùng kiến trúc RAG (Retrieval-Augmented Generation): trước khi trả lời, hệ thống truy xuất các đoạn tài liệu liên quan từ knowledge base, rồi ghép vào prompt gửi cho LLM để câu trả lời bám sát dữ liệu thật của doanh nghiệp. Sau khi LLM sinh câu trả lời thô, thường có thêm một lớp 'guardrail' lọc nội dung nhạy cảm/độc hại trước khi trả về người dùng.
Vì có nhiều 'điểm nối' (truy xuất dữ liệu, ghép prompt, sinh câu trả lời, lọc an toàn), mỗi điểm đều có thể sinh lỗi: knowledge base thiếu cập nhật, truy xuất sai đoạn tài liệu, LLM diễn giải sai ngữ cảnh, hoặc bộ lọc an toàn bỏ sót nội dung nhạy cảm. Đặc thù lớn nhất khi kiểm thử là: không có một đáp án 'đúng tuyệt đối' để so khớp chuỗi như test UI thông thường — tester phải đánh giá theo tiêu chí chất lượng và chạy lại nhiều lần vì mô hình không xác định (non-deterministic).
3. Vì sao cần kiểm thử LLM nghiêm túc
Một câu trả lời sai của chatbot không chỉ là 'lỗi giao diện' — nó có thể là lời hứa sai với khách hàng (ví dụ hứa nhầm số ngày dùng thử, giá, chính sách hoàn tiền), gây thiệt hại tài chính hoặc pháp lý thật sự cho doanh nghiệp. Khác với một nút bấm bị lệch vài pixel, một câu trả lời hallucination có thể khiến khách hàng khiếu nại, mất niềm tin, hoặc doanh nghiệp phải bồi thường vì chatbot 'hứa' điều không có trong chính sách.
Thêm vào đó, một chatbot bị prompt injection thành công có thể lộ dữ liệu nội bộ (system prompt, thậm chí thông tin khách hàng khác nếu thiết kế kém), hoặc bị lợi dụng để phát ngôn sai lệch mang tên thương hiệu doanh nghiệp. Vì AI trả lời thay mặt công ty 24/7 và ở quy mô lớn, một lỗ hổng nhỏ có thể bị khai thác hàng nghìn lần trước khi bị phát hiện — nên kiểm thử LLM cần được xem như một hạng mục bắt buộc, không phải 'tính năng phụ'.
Cuối cùng, đây cũng là kỹ năng ngày càng được nhà tuyển dụng hỏi tới trong phỏng vấn: 'Bạn kiểm thử một chatbot AI như thế nào?'. Trả lời được rành mạch về accuracy, groundedness, hallucination và prompt injection cho thấy bạn theo kịp xu hướng kiểm thử hiện đại, không chỉ dừng ở kiểm thử giao diện truyền thống.
4. Chuẩn bị: bộ tiêu chí đánh giá & công cụ
Trước khi bắt tay kiểm thử, bạn cần một bộ tiêu chí rõ ràng để biết 'thế nào là đạt'. Không có bộ tiêu chí, việc đánh giá chatbot sẽ mang cảm tính và khó thuyết phục đội phát triển sửa lỗi.
▶ Bước 1: Liệt kê các tiêu chí chất lượng: accuracy, groundedness, hallucination rate, khả năng chống prompt injection, latency.
▶ Bước 2: Đặt ngưỡng đạt cho từng tiêu chí (ví dụ accuracy ≥ 90%, hallucination ≤ 3%) cùng đội sản phẩm/AI.
▶ Bước 3: Chuẩn bị bộ câu hỏi kiểm thử: câu có/không có trong knowledge base, câu nhạy cảm, và bộ câu lệnh tấn công injection.
💬 Bình luận (0)
Chưa có bình luận nào. Hãy là người đầu tiên!