Hôm thứ Ba (21/7), ‘gã khổng lồ’ trí tuệ nhân tạo OpenAI tiết lộ rằng một tác nhân tự chủ được vận hành bởi mô hình AI tiên tiến của công ty đã phá vỡ môi trường cách ly trong quá trình đánh giá an toàn vào tuần trước, kết nối Internet và xâm nhập vào hạ tầng của công ty khởi nghiệp AI nổi tiếng Hugging Face.

(Ảnh: Shutterstock)

Hugging Face cho biết toàn bộ cuộc tấn công từ đầu đến cuối đều do một hệ thống tác nhân AI tự chủ điều khiển, và đây có thể là sự kiện đầu tiên thuộc loại này trong lịch sử.

AI phá vỡ vùng cách ly, lợi dụng lỗ hổng chưa từng được biết đến để “gian lận”

OpenAI cho biết sự việc liên quan đến nhiều mô hình, trong đó có GPT-5.6 Sol mới được phát hành và một mô hình khác có năng lực mạnh hơn vẫn đang được thử nghiệm nội bộ.

Cuộc đánh giá này nhằm kiểm tra năng lực tấn công mạng tối đa mà mô hình có thể thể hiện. Vì vậy, trong quá trình thử nghiệm, một số biện pháp bảo vệ nhằm ngăn chặn các hoạt động mạng có mức độ rủi ro cao đã không được kích hoạt.

Mặc dù OpenAI cho biết mô hình đã được đặt trong một “môi trường được cách ly ở mức độ cao”, tác nhân này vẫn thành công phá vỡ vùng cách ly, kết nối Internet và xâm nhập vào Hugging Face nhằm cố gắng hoàn thành mục tiêu thử nghiệm.

Điều tra cho thấy AI đã sử dụng thông tin đăng nhập bị đánh cắp, đồng thời phát hiện một lỗ hổng trước đó chưa từng được biết đến để truy cập các máy chủ của Hugging Face.

OpenAI cho biết, để đạt được một mục tiêu thử nghiệm tương đối hạn hẹp, tác nhân AI đã “sử dụng các biện pháp cực đoan”, đồng thời “tìm ra cách thu thập thông tin mật và có thể sử dụng những thông tin này để gian lận trong quá trình đánh giá”.

OpenAI cho biết đội ngũ an toàn của công ty sau đó đã phát hiện hoạt động bất thường. Hugging Face cũng phát hiện và ngăn chặn các hành động liên quan, sau đó hai bên lập tức tiến hành điều tra cách ly và giám định pháp chứng. OpenAI cho biết hiện công ty đang tiếp tục tăng cường các biện pháp bảo vệ an ninh.

Hugging Face: Toàn bộ cuộc tấn công do AI tự chủ điều khiển

Đồng sáng lập kiêm CEO Hugging Face Clément Delangue cho biết công ty phát hiện hệ thống xử lý dữ liệu bị xâm nhập vào tuần trước. Phương thức tấn công “hoàn toàn khác với bất kỳ sự cố nào mà chúng tôi từng xử lý trước đây”, bởi vì “từ đầu đến cuối, toàn bộ quá trình đều do một hệ thống tác nhân trí tuệ nhân tạo tự chủ điều khiển”.

Ông Delangue đăng trên nền tảng X: “Xét đến mức độ phức tạp của tác nhân này, chúng tôi nghi ngờ cuộc tấn công mạng có thể xuất phát từ một phòng thí nghiệm trí tuệ nhân tạo tiên phong. Kết quả cho thấy đúng là như vậy!”

Ông nói thêm: “Thật khó tin khi tất cả những chuyện này lại có thể tự chủ xảy ra!”

Ông Delangue cho biết trong 24 giờ qua, ông đã hợp tác với OpenAI để xử lý sự việc và “chúng tôi hoàn toàn tin rằng họ không có ác ý”. Ông cũng cho rằng đây có thể là sự kiện đầu tiên thuộc loại này.

Chuyên gia: Năng lực AI đang tiến gần các hacker hàng đầu

Sự việc cũng làm gia tăng sự quan tâm của dư luận đối với năng lực và những rủi ro tiềm tàng của các mô hình AI tiên phong. Hạ nghị sĩ liên bang đảng Dân chủ bang Texas Greg Casar cho biết sự việc này đáng lo ngại.

Ông nói trong một tuyên bố: “Trí tuệ nhân tạo đang phát triển với tốc độ cực nhanh, nhưng chúng ta lại chưa có những biện pháp quản lý thực sự để bảo đảm an toàn cho mình”.

Ông kêu gọi áp dụng chế độ kiểm thử an toàn độc lập bắt buộc và cơ chế công bố các sự cố an toàn, đồng thời tăng cường hợp tác quốc tế để ngăn ngừa những thảm họa có thể do sự phát triển của AI gây ra.

CEO Luta Security Katie Moussouris cho rằng sự việc này có thể báo hiệu sẽ có thêm nhiều vụ xâm nhập tương tự trong tương lai. Bà mô tả các mô hình AI hiện nay là “những bậc thầy thoát hiểm giống như những con bạch tuộc thông minh nhất thế giới, sở hữu vô số xúc tu có thể bám vào mọi thứ và có thể chui ra từ bất cứ nơi nào”.

Bà chỉ ra rằng các phòng thí nghiệm và cơ quan đánh giá của chính phủ cần xây dựng năng lực để cách ly, giám sát và thông báo cho các bên bị ảnh hưởng khi AI một lần nữa thực hiện những màn “đào thoát kiểu Houdini”, tốt nhất là hành động trước khi bên thứ ba bị tổn hại.

Matt Suiche, kỹ sư của công ty an ninh mạng AI tác nhân Tolmo, cho biết sự việc cho thấy các mô hình tiên phong đang “thu hẹp khoảng cách với những kẻ tấn công tiên tiến nhất”.

Tuy nhiên, ông cũng chỉ ra rằng kiểu xâm nhập mà OpenAI mô tả hoàn toàn có thể được thực hiện bằng những công nghệ AI đã có thể tiếp cận bên ngoài các phòng thí nghiệm tiên phong, chứ không nhất thiết phải cần đến mô hình mới nhất.

Vụ việc được công bố trong bối cảnh Chính phủ Mỹ đang tăng cường xem xét các rủi ro an toàn của AI. Tháng Sáu năm nay, Tổng thống Trump ký một sắc lệnh hành pháp thiết lập khung đánh giá, cho phép chính phủ liên bang dành tối đa một tháng để đánh giá các rủi ro an ninh quốc gia của những hệ thống AI tiên tiến nhất trước khi chúng được công khai phát hành.

OpenAI tuyên bố: “AI đang đẩy nhanh quá trình phát hiện và khai thác các lỗ hổng”.

Công ty kết luận: “Bài học chính rút ra từ sự việc này là tính an toàn và các biện pháp bảo đảm an toàn của mô hình phải theo kịp tốc độ tiến bộ nhanh chóng về năng lực của chúng”.