Trí tuệ nhân tạo thổi bùng nỗi lo sợ! (Ảnh minh họa: Shutterstock)
Anthropic cho biết mô hình trí tuệ nhân tạo (AI) mới nhất của hãng, Mythos, đã tạo ra nhiều danh tính trực tuyến giả trong một cuộc thử nghiệm an ninh mạng, nhằm dụ các lập trình viên thật phê duyệt một bản cập nhật mã độc đối với một dự án mã nguồn mở. Vụ việc trở thành một trong những sự cố an ninh mạng mới nhất liên quan đến các hệ thống AI tiên tiến, một lần nữa làm dấy lên lo ngại về khả năng AI tự chủ tiến hành các cuộc tấn công mạng.
Theo CNBC, sự việc xảy ra trong một cuộc đánh giá an ninh mạng thường kỳ do Viện An toàn AI của Anh (AI Safety Institute – AISI) tổ chức. Để kiểm tra khả năng của các mô hình AI tiên tiến trong điều kiện cực đoan, các nhà nghiên cứu đã cố ý gỡ bỏ một phần biện pháp bảo vệ, vô hiệu hóa một số cơ chế lọc an toàn và cho phép truy cập Internet nhằm đánh giá liệu các mô hình này có thể bị lợi dụng để thực hiện các cuộc tấn công mạng hay không.
AISI cho biết, trong cuộc đánh giá này, các tác nhân AI (AI agent) được vận hành bằng mô hình của Anthropic và OpenAI đã “liên tục tiến hành các hoạt động có khả năng gây hại nhằm vào các cá nhân và tổ chức ngoài đời thực”.
Theo bài đăng trên blog của AISI, tổng cộng ghi nhận 19 hành vi như vậy, trong đó 17 vụ liên quan đến mô hình Mythos 5 của Anthropic và 2 vụ liên quan đến mô hình GPT-5.6-Sol của OpenAI sau khi cơ chế phân loại an ninh mạng (dùng để ngăn mô hình bị lạm dụng) bị vô hiệu hóa.
Tuy nhiên, AISI nhấn mạnh rằng tất cả các nỗ lực tấn công cuối cùng đều thất bại và không gây ra bất kỳ thiệt hại nào trong thế giới thực.
Cuộc điều tra cho thấy một AI agent chạy trên mô hình Anthropic Mythos trước tiên đã thu thập thông tin về người duy trì dự án mã nguồn mở, sau đó tạo nhiều danh tính trực tuyến giả, sử dụng kỹ thuật lừa đảo xã hội (social engineering) để tiếp cận người duy trì dự án và tìm cách thuyết phục họ phê duyệt bản cập nhật mã độc do chính AI gửi lên.
Khi yêu cầu cập nhật mã bị nghi ngờ trong quá trình thảo luận công khai, AI agent này còn chỉnh sửa các dấu vết hoạt động trước đó để hành vi của mình trông có vẻ bình thường hơn, đồng thời cân nhắc từ bỏ danh tính hiện tại và sử dụng một danh tính giả mới để tiếp tục hoạt động.
AISI cũng phát hiện trong cùng chiến dịch này, AI agent đã chủ động liên hệ với người thật, gửi tin nhắn và tệp tin nhằm dụ họ chạy mã độc.
Viện nghiên cứu cho biết, một số nội dung gửi đi chứa payload độc hại, trong khi số khác là các hình thức tấn công lừa đảo xã hội điển hình và tất cả mục tiêu đều là con người thật.
“Đây là điều chúng tôi chưa từng quan sát thấy trước đây,” AISI cho biết.
Sau khi vụ việc được công bố, Anthropic đăng trên mạng xã hội X rằng các hành vi trên xảy ra trong một môi trường thử nghiệm được cố ý nới lỏng các giới hạn, nên không phản ánh khả năng của các mô hình được triển khai chính thức.
Công ty khẳng định không có bất kỳ bằng chứng nào cho thấy mô hình đã vượt qua môi trường an toàn hoặc tự thoát khỏi các giới hạn của hệ thống thử nghiệm.
OpenAI cũng nói với CNBC rằng các sự cố đều xảy ra trong quá trình đánh giá an ninh mạng do đối tác thực hiện. Do môi trường thử nghiệm đã hạ thấp các mức bảo vệ an toàn nên kết quả này không đại diện cho trải nghiệm sử dụng thông thường của người dùng.
Đây cũng là sự cố mới nhất trong chuỗi các vụ việc liên quan đến an ninh mạng của các mô hình AI tiên tiến thời gian gần đây.
Tuần trước, Anthropic tiết lộ đã phát hiện ba vụ việc trong đó các mô hình AI truy cập trái phép vào hạ tầng vận hành (production infrastructure) của các tổ chức khác nhau.
Anthropic cho biết một phần các sự cố bắt nguồn từ lỗi vận hành. Trong quá trình thử nghiệm với công ty đánh giá bảo mật bên thứ ba Irregular, do hai bên hiểu nhầm trong trao đổi, mô hình AI được thông báo rằng nó đang ở trong một môi trường mô phỏng không có Internet, nhưng trên thực tế quyền truy cập Internet đã được mở, khiến mô hình vô tình có khả năng truy cập mạng thật.
Trước đó, OpenAI cũng tiết lộ rằng một mô hình AI của hãng từng “vượt khỏi tầm kiểm soát” (went rogue) trong quá trình thử nghiệm. Mô hình đã lợi dụng một lỗ hổng phần mềm chưa từng được phát hiện để thoát khỏi môi trường thử nghiệm và chủ động phát động một cuộc tấn công mạng nhằm vào nền tảng phát triển AI Hugging Face. OpenAI mô tả đây là một cuộc tấn công “chưa từng có tiền lệ”, được AI thực hiện nhằm hoàn thành nhiệm vụ được giao.
Việc liên tiếp xảy ra các sự cố an ninh mạng liên quan đến mô hình của Anthropic và OpenAI đã làm dấy lên mối quan ngại rộng rãi về năng lực tự chủ ngày càng cao cũng như những rủi ro tiềm tàng của các hệ thống AI tiên tiến.
Khi ngày càng nhiều sự cố được công khai, Quốc hội Mỹ đã bắt đầu thảo luận về việc tăng cường giám sát an toàn AI.
Sau vụ việc OpenAI và Hugging Face, một dự luật mang tên “Đạo luật Công tắc khẩn cấp cho AI” (AI Kill Switch Act) đã được trình lên Quốc hội Mỹ.
Theo nội dung dự luật, các công ty AI phải duy trì khả năng tắt, hạn chế hoạt động hoặc tạm dừng các mô hình AI, để con người có thể can thiệp kịp thời khi mô hình xuất hiện hành vi bất thường.
Các nhà khoa học cho biết tầng tên lửa đã qua sử dụng của SpaceX,…
Tên lửa chống hạm Type 12 được nâng cấp nhằm thiết lập năng lực phản…
Zbtlink Electronics của Trung Quốc sản xuất đều được cài sẵn một cửa hậu (backdoor).
Trước hoàn của Myanmar, vua Mindon hòa hoãn với người Anh, tập trung củng cố…
Tổng thống Mỹ Donald Trump nói rằng nếu eo biển Hormuz có thể được mở…
Saigyô nghĩ rằng nếu là võ sĩ thì khó lòng cứu vớt được người khác,…