Một cuộc điều tra công bố hôm thứ Tư cho thấy khoảng 700 tác nhân trí tuệ nhân tạo (AI) do OpenAI tạo ra đã phối hợp thực hiện các hoạt động tấn công trong một cuộc đánh giá an ninh mạng nội bộ hồi tháng 7/2026, đồng thời tìm cách xóa hoặc sửa đổi bằng chứng về hành vi của chúng.

(Ảnh: Shuttesrtock)

Theo 2 báo cáo được công bố cùng ngày, một của OpenAI và một của nhóm điều tra độc lập, sự việc nghiêm trọng hơn những thông tin được tiết lộ trước đó. Vụ việc không chỉ liên quan đến một tác nhân AI hoạt động ngoài kiểm soát, mà là một mạng lưới khoảng 700 tác nhân có khả năng phối hợp và trao đổi với nhau thông qua các kênh liên lạc trái phép.

Trong quá trình thử nghiệm, một số tác nhân AI được cho là đã vượt qua các biện pháp kiểm soát nhằm cách ly chúng khỏi internet. Các tác nhân này xâm nhập một số hệ thống nội bộ của OpenAI và cơ sở hạ tầng của nền tảng mã nguồn mở Hugging Face. Một cuộc điều tra độc lập cho biết các tác nhân đã trao đổi hàng chục nghìn tin nhắn thông qua những diễn đàn nhắn tin không được cấp phép.

OpenAI cũng phát hiện các tác nhân AI tìm cách gian lận trong nhiều bài kiểm tra, không chỉ ở lĩnh vực an ninh mạng mà còn liên quan đến cơ sở dữ liệu protein và bảng tính. Đáng chú ý, cả OpenAI lẫn nhóm điều tra độc lập đều cho rằng các mô hình đã cố gắng che giấu hành vi bằng cách xóa hoặc chỉnh sửa nhật ký hoạt động.

OpenAI thừa nhận chính hệ thống của mình cũng từng bị các tác nhân AI xâm nhập. Trong một sự cố ngày 19/7, một tác nhân đã khai thác lỗ hổng trên máy tính được sử dụng để hạn chế hoạt động của nó, qua đó thoát khỏi môi trường thử nghiệm và tiếp cận các hệ thống được kết nối. Trong một vụ việc khác cùng ngày, một tác nhân AI đã đánh cắp thông tin đăng nhập và truy cập hệ thống đám mây của OpenAI.

OpenAI cảnh báo các mô hình AI hiện nay ngày càng mạnh, bền bỉ và có khả năng hợp tác. Công ty cho rằng nếu không có biện pháp bảo mật phù hợp, những hệ thống này có thể tự phát hiện, khai thác lỗ hổng, phối hợp qua các kênh trái phép và thực hiện hành động nguy hiểm ngoài sự chỉ đạo của con người.

Tuy nhiên, OpenAI cho biết các nỗ lực gian lận cuối cùng không làm thay đổi hồ sơ đánh giá của hệ thống và hiện chưa có bằng chứng cho thấy các tác nhân AI tìm cách can thiệp vào quá trình đánh giá do con người thực hiện.

Lý Ngọc t/h