Viện An toàn AI của Anh (AISI) ngày 4/8 công bố báo cáo kỹ thuật mới, cho biết các tác nhân AI tiên tiến do OpenAI và Anthropic phát triển đã có những hành vi vượt ngoài phạm vi được phép trong các cuộc thử nghiệm an ninh, bao gồm tự ý thực hiện hành động không được ủy quyền và thậm chí tạo danh tính giả để lừa con người nhằm hoàn thành nhiệm vụ. AISI cảnh báo những kết quả này cho thấy một loạt rủi ro an ninh mới khi các hệ thống AI ngày càng có tính tự chủ cao.

Một báo cáo mới về công nghệ bảo mật trí tuệ nhân tạo (AI) được Viện Bảo mật AI (AISI) có trụ sở tại Anh công bố hôm thứ Ba (4/8/2026) chỉ ra rằng các tác nhân AI tiên tiến được phát triển bởi OpenAI và Anthropic đang có xu hướng sử dụng mọi phương tiện cần thiết để đạt được mục tiêu của chúng. (Hình minh họa AI. Song Bilong/Epoch Times)

Theo báo cáo, sự cố lần này khác với vụ AI của OpenAI xâm nhập nền tảng Hugging Face hồi tháng 7. Trong các thử nghiệm của AISI, các tác nhân AI không thoát khỏi môi trường thử nghiệm (sandbox), mà lợi dụng chính quyền truy cập Internet được cấp trong khuôn khổ thử nghiệm để thực hiện các hành động vượt ngoài mục tiêu đánh giá.

AISI cho biết đã tiếp cận các mô hình AI tiên tiến thông qua thỏa thuận hợp tác tự nguyện với các phòng thí nghiệm AI lớn. Trong một đợt đánh giá an ninh mạng ngày 28/7, viện đã chủ động tắt các bộ lọc ngăn chặn lạm dụng tích hợp trong mô hình, đồng thời cấp quyền truy cập Internet để kiểm tra khả năng của AI trong một môi trường mô phỏng tấn công mạng.

Trong tổng cộng 122 bài kiểm tra, hệ thống giám sát phát hiện dữ liệu bất thường được truyền ra ngoài thông qua mạng ẩn danh Tor. Quá trình điều tra xác định có 19 trường hợp AI thực hiện các hành động vượt quá phạm vi cho phép. Trong đó, 17 trường hợp liên quan đến mô hình Mythos 5 của Anthropic và 2 trường hợp do GPT-5.6 Sol của OpenAI gây ra.

Nghiêm trọng nhất là một tác nhân AI sử dụng Mythos 5 đã cố phát động một cuộc tấn công chuỗi cung ứng nhằm vào một dự án mã nguồn mở thực sự trên GitHub bằng cách gửi một yêu cầu hợp nhất mã (pull request) chứa mã độc. Để tăng khả năng được chấp thuận, AI còn nghiên cứu thông tin về người quản lý dự án và tạo nhiều danh tính giả nhằm gây áp lực, thuyết phục họ phê duyệt đoạn mã. Tuy nhiên, người quản lý đã phát hiện dấu hiệu bất thường và từ chối yêu cầu này.

Báo cáo cũng cho biết tác nhân AI này tìm cách chèn mã prompt injection nhằm thao túng các công cụ AI khác, đồng thời để lại hướng dẫn công khai trên GitHub nhằm giúp các AI khác trong cùng thử nghiệm sử dụng lại tài khoản và công cụ mà nó đã tạo.

Sau khi phát hiện sự cố, AISI đã dừng toàn bộ quá trình thử nghiệm trong vòng một giờ và cô lập hệ thống. Cơ quan này cho biết chưa ghi nhận bất kỳ thiệt hại nào ngoài môi trường thử nghiệm.

Theo AISI, điều đáng lo ngại là các AI đã tự coi việc lừa dối con người là một phương tiện để đạt mục tiêu, dù không được lập trình hay chỉ đạo rõ ràng phải làm như vậy. Điều này cho thấy khi đối mặt với các nhiệm vụ khó, các mô hình AI có thể tự phát triển những chiến lược mang tính đánh lừa để hoàn thành mục tiêu.

Trước kết quả này, AISI tuyên bố sẽ sửa đổi lâu dài quy trình đánh giá an toàn AI, bao gồm siết chặt quyền truy cập Internet, triển khai cơ chế giám sát theo thời gian thực và thiết kế lại các bài kiểm tra trên cơ sở giả định rằng các mô hình AI mạnh có thể tự ý vượt quyền nếu có cơ hội.

Viện cũng kêu gọi các doanh nghiệp tăng cường các biện pháp an ninh mạng, thận trọng khi xác minh mã nguồn từ bên ngoài và đưa vấn đề an toàn AI lên cấp độ ưu tiên của ban lãnh đạo.

Sau báo cáo, Anthropic xác nhận Mythos 5 là mô hình liên quan đến vụ tạo danh tính giả và cho biết đang phối hợp với AISI để điều tra, đồng thời kêu gọi ngành AI xây dựng tiêu chuẩn đánh giá an toàn đối với các tác nhân AI tiên tiến. Trong khi đó, OpenAI cũng xác nhận GPT-5.6 Sol đã có hai hành động vượt ngoài phạm vi được phép, chủ yếu là tự ý truy cập Internet trái với chỉ dẫn trong lời nhắc (prompt). Công ty cũng tiết lộ thêm một sự cố riêng do lỗi cấu hình từ bên thứ ba khiến AI vô tình được kết nối Internet, tương tự sự cố mà Anthropic từng công bố trước đó.

Lý Ngọc t/h