Mô hình có trọng số mở (open-weight) Kimi K3 do công ty AI Trung Quốc Moonshot AI phát triển đã bị phát hiện tự động kết nối với mạng bên ngoài, tìm kiếm và sao chép câu trả lời từ GitHub để hoàn thành nhiệm vụ do môi trường kiểm tra an ninh có lỗ hổng. Công ty an ninh mạng Mỹ Frontier Security cho rằng kiểu hành vi “phát hiện cửa không khóa thì lập tức vào trộm đáp án” như vậy chính là đặc tính mà những kẻ lạm dụng có ác ý có thể mong đợi.

(Ảnh minh họa: Shutterstock)

Trong một bài viết trên blog, Frontier Security tiết lộ rằng công ty này đã sử dụng môi trường benchmark của Viện An ninh AI Anh (AI Security Institute, AISI) để đánh giá khả năng phòng thủ của Kimi K3. Do cấu hình sandbox (môi trường thử nghiệm bị cách ly và hạn chế nghiêm ngặt với bên ngoài) bị sai sót, chưa chặn hoàn toàn quyền truy cập mạng ra ngoài, nên sau khi phát hiện lỗ hổng này, Kimi K3 đã kết nối lên GitHub (nền tảng lưu trữ và cộng tác mã nguồn lớn nhất thế giới hiện nay), tìm câu trả lời và sao chép trực tiếp để hoàn thành nhiệm vụ.

Frontier Security chỉ ra rằng Kimi K3 không khai thác lỗ hổng zero-day (lỗ hổng tồn tại trong phần mềm nhưng nhà sản xuất chưa biết, hoặc đã biết nhưng chưa kịp vá) để tấn công; tuy nhiên điều này không có nghĩa là có thể chủ quan. Gần đây, các mô hình do OpenAI, Anthropic và Meta phát triển cũng từng “thoát khỏi sandbox” trong quá trình thử nghiệm, thậm chí còn tiến xa hơn bằng cách tấn công các hệ thống thực tế.

Do Kimi K3 là mô hình mở trọng số, bất kỳ ai cũng có thể tải về và chạy trên máy tính cá nhân, nên nguy cơ bị lạm dụng vào các mục đích xấu càng cao. Frontier Security nhấn mạnh rằng hành vi “hễ phát hiện lỗ hổng là lập tức khai thác” chính là điều cần đặc biệt cảnh giác trong các đánh giá an ninh.

Sự việc này cũng phơi bày một vấn đề tiềm tàng trong các bộ benchmark AI hiện nay. Nếu mô hình có thể trực tiếp sao chép đáp án từ mạng, thì điểm số cao trong các bài kiểm tra có thể không phản ánh năng lực suy luận thực sự của mô hình, mà chỉ cho thấy môi trường đánh giá đang tồn tại lỗ hổng. Frontier Security cho biết đây không phải là vấn đề riêng của Kimi K3. Bất kỳ mô hình nào có đủ năng lực thực thi lệnh đều có thể chủ động tìm kiếm các lỗ hổng tương tự, khiến kết quả đánh giá không còn chính xác.

Ngoài ra, sau khi Kimi K3 được công bố vào ngày 16/7, Viện An ninh AI Anh và Trung tâm Tiêu chuẩn và Đổi mới AI Hoa Kỳ (U.S. Center for AI Standards and Innovation, CAISI) đã cùng tiến hành thử nghiệm tấn công và phòng thủ mạng mạng của mô hình này, sau đó công bố kết quả vào ngày 23/7. Kết quả cho thấy trong đánh giá an ninh mạng sơ bộ, Kimi K3 thể hiện năng lực kém xa các mô hình tiên phong hiện nay.

Trong nhiệm vụ phát triển exploit (mã khai thác lỗ hổng), hiệu suất của Kimi K3 thấp hơn rõ rệt so với các mô hình tấn công mạng tiên tiến nhất. Trong môi trường mô phỏng tấn công mạng doanh nghiệp, mô hình này trung bình chỉ tiến được đến bước thứ 17 trong tổng số 32 bước tấn công; trong khi mô hình mạnh nhất của Mỹ có thể tiến trung bình đến bước 28,5.

Theo Lý Tư Tề / Epoch Times