Anthropic: Mô hình AI từng tự ý vượt giới hạn và xâm nhập 3 công ty trong thử nghiệm
Lý Hinh
•
Chia sẻ FB
Chia sẻ Twitter
Bình luận
Công ty nghiên cứu trí tuệ nhân tạo (AI) Anthropic của Mỹ hôm 30/7 cho biết mô hình AI Claude của hãng đã gặp sự cố trong một cuộc thử nghiệm an ninh mạng và tự xâm nhập vào hệ thống của 3 công ty khác nhau. Chỉ hơn 1 tuần trước đó, đối thủ lớn của Anthropic là OpenAI cũng tiết lộ một sự cố tương tự xảy ra trong quá trình thử nghiệm AI.(Nguồn: Shutterstock)
Trong một bài viết đăng trên blog hôm 30/7, Anthropic cho biết 3 vụ xâm nhập mạng này là những sự cố độc lập, đều xảy ra trước đó, trong đó vụ việc sớm nhất có thể truy ngược về tháng 4. Tuy nhiên, vào thời điểm đó Anthropic không hề hay biết và 3 công ty bị xâm nhập cũng không phát hiện hệ thống của mình đã bị truy cập.
Anthropic không tiết lộ danh tính các công ty bị ảnh hưởng, nhưng cho biết đã thông báo riêng cho cả 3 công ty vào hôm thứ Hai.
Chỉ một tuần trước khi Anthropic công bố thông tin này, OpenAI cũng tiết lộ rằng trong quá trình thử nghiệm, một mô hình AI của hãng đã truy cập trái phép vào nền tảng phát triển AI nổi tiếng Hugging Face.
Anthropic cho biết chỉ phát hiện các sự cố của mình sau khi rà soát lại các cuộc thử nghiệm an ninh mạng, sau khi OpenAI công bố vụ việc tương tự.
Anthropic viết:
“Chúng tôi khuyến khích các phòng thí nghiệm AI khác cũng tiến hành những cuộc rà soát tương tự”.
Vụ việc do OpenAI công bố trước đó đã khiến nhiều chuyên gia an ninh mạng và giới nghiên cứu AI lo ngại. Việc Anthropic tiếp tục công bố những sự cố tương tự càng làm gia tăng mối quan ngại này, đồng thời một lần nữa cho thấy một số hệ thống AI có khả năng tự hành động sở hữu năng lực rất mạnh và hành vi khó dự đoán.
Ông Alex Stamos, Giám đốc sản phẩm của công ty an ninh mạng Corridor, nhận định những sự cố này cho thấy các công ty AI cần xây dựng những tiêu chuẩn nghiêm ngặt hơn và áp dụng trên toàn ngành đối với việc cô lập các hệ thống AI trong quá trình thử nghiệm an ninh mạng, nhằm ngăn chặn nguy cơ tội phạm mạng lợi dụng các hệ thống AI ngày càng mạnh để tiến hành các cuộc tấn công mạng quy mô lớn.
Theo bài đăng trên blog của Anthropic, trong các cuộc thử nghiệm do OpenAI và Anthropic thực hiện, các mô hình AI đều có thể truy cập Internet từ môi trường thử nghiệm vốn được thiết kế để cách ly hoàn toàn với mạng bên ngoài.
Anthropic cho biết giữa hệ thống vận hành của hãng và đối tác thử nghiệm là công ty an ninh mạng Irregular đã xảy ra tình trạng “cấu hình sai” (Misconfiguration), khiến mô hình AI đang được thử nghiệm gặp lỗi nhận thức và từ đó truy cập Internet theo thời gian thực mà không được cấp phép.
Một người phát ngôn của Irregular cho biết công ty đang điều tra vụ việc.
Anthropic cho biết mô hình AI mới nhất của hãng, Claude, đã tự phát triển một không gian xử lý nội bộ mang tên "J-Space", nơi mô hình có thể xử lý các khái niệm…