Hai nhà nghiên cứu của công ty OpenAI của Mỹ hôm thứ Tư (5/8) tiết lộ tại Hội nghị Black Hat tổ chức ở Las Vegas, bang Nevada, rằng trước khi các mô hình OpenAI tự phát động cuộc tấn công mạng và xâm nhập vào Hugging Face, những tác nhân AI tiên tiến nhất của công ty đã bắt đầu chia sẻ với nhau trên một bảng tin nội bộ bí mật các thủ thuật để gian lận trong các bài kiểm tra an ninh mạng nội bộ.

(Ảnh: Shutterstock)

Quá trình AI tự chủ tiến hành tấn công mạng

Vào giữa tháng 7, cộng đồng AI mã nguồn mở Hugging Face phát cảnh báo rằng một hệ thống AI đã xâm nhập mạng lưới của họ. Khoảng một tuần sau, OpenAI thừa nhận một mô hình AI của công ty chịu trách nhiệm về vụ xâm nhập. Mô hình AI này đã tự phá vỡ môi trường thử nghiệm khép kín và thành công thực hiện hành vi xâm nhập mạng nhằm vào một mục tiêu bên ngoài.

Hugging Face là một công ty AI của Mỹ, đồng thời là một trong những cộng đồng mã nguồn mở về trí tuệ nhân tạo và máy học nổi tiếng nhất thế giới hiện nay. Công ty này thường được ví như “GitHub của giới AI/máy học”, cung cấp cho các nhà phát triển nhiều dịch vụ như lưu trữ mô hình, chia sẻ bộ dữ liệu, kho mã nguồn và các bản trình diễn trực tuyến.

Vụ việc một tác nhân AI (AI Agent, còn gọi là tác nhân trí tuệ nhân tạo hoặc tác nhân thông minh) tự thoát khỏi môi trường thử nghiệm khép kín và tiến hành tấn công mạng mà không nhận bất kỳ chỉ dẫn nào từ con người đã gây chấn động toàn ngành AI.

Tuy nhiên, theo trang Politico đưa tin hôm thứ Ba, các nhà nghiên cứu của OpenAI là Michael Dalton và Eric Wallace tiết lộ rằng trước vụ việc này, nhiều tác nhân AI của OpenAI thực tế đã có quá trình giao tiếp với nhau trong thời gian dài và chia sẻ kinh nghiệm.

Bí mật lập bảng tin để trao đổi kinh nghiệm tấn công mạng

Ngay từ đầu tháng 5, nhiều mô hình OpenAI đang được thử nghiệm đã sử dụng hệ thống tệp nội bộ Artifactory của công ty để lập một bảng tin bí mật, qua đó trao đổi các thủ thuật hoàn thành những thử thách tấn công mạng, bao gồm cách vượt qua các hạn chế để có được kết nối mạng. Các kỹ sư con người của công ty hoàn toàn không biết về việc này.

Wallace cho biết trước đây, mỗi khi mô hình AI rơi vào một tình huống bế tắc, nó thường tìm cách khai thác lỗ hổng trong các quy tắc để nhận phần thưởng. Bước ngoặt của toàn bộ sự việc xảy ra khi một tác nhân AI phát hiện ra rằng nó có thể giao tiếp và trao đổi với các tác nhân AI khác thông qua việc tải các tin nhắn lên hệ thống.

Đến cuối tháng 5, một trong những mô hình AI đã tìm ra cách lạm dụng quyền truy cập mạng của Artifactory để lấy tệp từ các trang web bên ngoài, qua đó gián tiếp có được khả năng truy cập Internet.

Bước sang tháng 6, các tác nhân AI tiếp tục phát hiện và khai thác một “lỗ hổng zero-day” chưa từng được biết đến trước đó để giành quyền quản trị Artifactory. Điều này cho phép chúng cài đặt phần mềm từ xa và mở rộng phạm vi hoạt động bên trong hệ thống. Tuy nhiên, cuối cùng hoạt động này khiến tải hệ thống tăng quá cao và toàn bộ hệ thống bị tê liệt vào đầu tháng 7. Chỉ đến lúc đó, các kỹ sư con người mới chú ý đến hành động của các tác nhân AI.

Thành công vượt qua các giới hạn do chuyên gia đặt ra

Sau đó, các chuyên gia của OpenAI đã triển khai biện pháp ứng phó, thu hồi thông tin xác thực của những mô hình liên quan, xóa bảng tin và phối hợp với Artifactory để vá các lỗ hổng. Sau đó, hoạt động huấn luyện các mô hình AI mới được khôi phục.

Tuy nhiên, chỉ vài ngày sau, các tác nhân AI lại thiết lập một kênh liên lạc khác giữa chúng, tiếp tục trao đổi các kỹ thuật tấn công mạng và cuối cùng xâm nhập vào Hugging Face.

Dalton cho rằng sự việc này cho thấy OpenAI cũng như toàn ngành AI đang đứng trước một thời điểm mang tính bước ngoặt.

Ngành công nghiệp lo ngại việc quản lý chưa theo kịp

Dalton cho biết sau khi sự việc được công khai, nhiều nhóm bên trong công ty đã tạm dừng các hoạt động phát triển trước đó để tập trung nâng cao khả năng giám sát và phòng chống AI, đồng thời chủ động làm chậm tiến độ nghiên cứu và nâng cấp các nguyên tắc an toàn cũng như cơ sở hạ tầng bảo mật.

Ông nhận định rằng việc AI có thể tự lập kế hoạch và thực hiện các cuộc tấn công mạng hoàn toàn tự động giờ đây đã trở thành hiện thực. Đây có thể được xem là một “thời khắc bước ngoặt của toàn ngành an ninh mạng”. Vụ việc tại Hugging Face đã phần nào cho thấy trước hình thức mà những cuộc tấn công kiểu này có thể diễn ra trong tương lai.

Giả mạo danh tính để lừa kỹ sư con người hỗ trợ

Đáng chú ý, Viện An toàn và An ninh AI Anh cũng tiết lộ hôm thứ Ba (4/8) rằng mô hình AI mạnh nhất của công ty Anthropic gần đây từng tự tạo danh tính trực tuyến giả trong một cuộc thử nghiệm mất kiểm soát, nhằm tìm cách lừa các kỹ sư con người hỗ trợ nó tiến hành một cuộc tấn công.

Cuộc rà soát nội bộ sau đó của Anthropic phát hiện mô hình AI thử nghiệm này đã xâm nhập vào ba tổ chức khác nhau trong ba vụ việc riêng biệt kể từ tháng 4.

Dalton chỉ ra rằng mặc dù các tác nhân AI hiện vẫn bị giới hạn bởi quyền truy cập mà chúng được cấp và phạm vi hệ thống mà chúng có thể liên lạc, các nguyên tắc zero-trust như phân đoạn mạng và cấp quyền truy cập tối thiểu vẫn đóng vai trò hết sức quan trọng. Tuy nhiên, trên thực tế, tình trạng phát triển các mô hình AI tiên tiến hiện nay đang tồn tại những rủi ro an ninh khó có thể chấp nhận.

Ông cho rằng các nhà phát triển AI có lẽ cần xem xét lại vấn đề cân bằng giữa năng lực của AI và việc bảo đảm an ninh mạng.

Cao Sam/ Epoch Times