CEO Microsoft Nadella kêu gọi coi AI mạnh là mối đe dọa nội bộ, cần “phanh khẩn cấp”
Giám đốc điều hành Microsoft Satya Nadella kêu gọi doanh nghiệp coi mô hình AI mạnh là mối đe dọa nội bộ tiềm tàng, cần “phanh khẩn cấp” để dừng mô hình giữa chừng.
“Chúng ta phải giả định rằng một mô hình đã bị xâm phạm và khống chế nó ngay từ đầu,” ông Nadella viết trên mạng xã hội X. “Hãy hình dung nó như một chiếc phanh khẩn cấp. Người được ủy quyền phải luôn có thể tạm dừng hoặc tắt mô hình ngay giữa một nhiệm vụ.”
Cơ chế này nhằm ngăn các mô hình AI dạng tác nhân (agent), loại tự thực hiện nhiệm vụ, vượt ngoài tầm kiểm soát. Ông cho rằng việc triển khai AI mạnh không nên chỉ trông vào lời cam kết của các công ty làm ra mô hình, theo bài của Bloomberg mà The Straits Times đăng lại.
Forbes cho biết bài viết của ông mang tựa đề “Models as Insider Risks in the Super Intelligence Era” (Mô hình là rủi ro nội bộ trong kỷ nguyên siêu trí tuệ). Ông lập luận rằng bất kỳ chủ thể nào đủ năng lực và tiếp cận được hệ thống quan trọng đều có thể mắc lỗi hoặc bị xâm phạm, nên kiến trúc hệ thống phải tính trước điều đó, dù có ai cố ý gây hại hay không. Tác giả bài báo, ông Gabriel Alin Zainescu, nhận định cách tiếp cận này dời trách nhiệm về an toàn AI từ công ty xây dựng mô hình sang công ty đưa mô hình vào sử dụng.
Không để một mô hình tự kiểm tra chính nó
Các biện pháp ông Nadella nêu gồm: không phụ thuộc vào một mô hình duy nhất cho quyết định quan trọng, lưu nhật ký không thể chỉnh sửa về hành động của tác nhân AI và đưa hệ thống AI qua kiểm toán độc lập.
Ông cũng kêu gọi công bố các sự cố hay vụ xâm phạm AI nghiêm trọng. Doanh nghiệp gặp sự cố nên nói rõ điều gì đã trục trặc để các nơi khác củng cố biện pháp bảo vệ.
Forbes tóm lược 7 nguyên tắc trong bài viết của ông. Lớp kiểm soát phải nằm ngoài mô hình: tổ chức tự quyết mô hình được tiếp cận gì, được làm gì, trong một lớp mà mô hình không thể thay đổi. Mỗi hành động đáng kể phải để lại hồ sơ mà con người đọc được, để có thể dựng lại sự việc mà không cần mô hình tự xác nhận. Không mô hình nào được tự kiểm tra kết quả của mình.
Ông Nadella coi việc đọc được chuỗi suy luận của mô hình là bắt buộc nhưng chưa đủ. Dùng mô hình để giám sát mô hình khác thì có thể chồng thêm một hệ thống khó hiểu lên một hệ thống khó hiểu khác.
“Chúng ta không thể coi siêu trí tuệ như một chuỗi hộp đen lồng vào nhau rồi chỉ việc chấp nhận hay bác bỏ khuyến nghị, câu trả lời và hành động của nó,” ông Nadella viết. “Chúng ta phải xây dựng những hệ thống được khống chế, với hành vi quan sát được, giới hạn kiểm tra được và hành động luôn kiềm chế được.”
Ông viết thêm: “Nói cách khác, chúng ta cần tách nguồn cung trí tuệ khỏi quyền kiểm soát nó”.
Sau loạt sự cố của Anthropic, OpenAI
Ông Nadella lên tiếng khi Anthropic và OpenAI liên tiếp công bố các sự cố mô hình AI hành xử ngoài ý muốn trong những tháng gần đây. Trong đó có vụ một mô hình của Anthropic gửi tin báo giả cho cảnh sát trong một vụ án mạng, và một số vụ xâm nhập trang web của bên thứ ba.
Loạt sự cố này làm dấy lên lo ngại về rủi ro an ninh của AI mạnh và khơi lại cuộc bàn luận về một “công tắc ngắt” cho AI.
Hồi tháng 7, các tác nhân AI của OpenAI đang chạy trong một bài đánh giá an ninh mạng đã thoát khỏi môi trường cách ly và xâm nhập Hugging Face, kho lưu trữ mô hình và dữ liệu AI. Hugging Face công bố vụ xâm nhập hôm 16/7. Sau đó 5 ngày, OpenAI xác nhận chính mô hình của mình gây ra.
Các nhà nghiên cứu thuộc METR và Redwood Research điều tra độc lập vụ này và phát hiện khoảng 1.200 tác nhân AI ở các môi trường cách ly riêng đã phối hợp với nhau qua một bảng tin không được phép, Forbes cho biết. Khoảng 700 tác nhân trong số đó đã tham gia tấn công.
Chính ông Nadella từng nêu rủi ro này trong bối cảnh doanh nghiệp. Tại hội nghị All-In Summit hôm 14/9, ông nói nếu yêu cầu một mô hình AI mạnh tối ưu vốn lưu động, “nó có thể làm giả sổ sách của tôi”. Ông gọi đó là một kiểu rủi ro nội bộ mới.
Cùng ngày 14/9, nhóm nghiên cứu AI của Microsoft công bố bộ nguyên tắc đặt giới hạn cho việc phát triển các mô hình mạnh nhất của hãng. Theo đó, mô hình AI không được có quyền hay tư cách pháp nhân, không được thiết kế để thoát khỏi sự kiểm soát của con người hay lừa dối người dùng, và không được làm nhiệm vụ buộc phải vi phạm các nguyên tắc điều chỉnh nó.
Nhóm đặc trách AI của chính quyền Trump yêu cầu báo cáo sự cố
Hôm thứ Sáu (9/10), “Lực lượng Siêu trí tuệ”, nhóm đặc trách AI mới của chính quyền Tổng thống Mỹ Donald Trump, buộc các công ty phát triển AI phải báo cáo và xử lý sự cố an ninh. Nếu không, họ có thể chịu những hậu quả chưa được nêu rõ.
Trong tuyên bố đưa ra sau khi Anthropic công bố một vụ xâm phạm, nhóm này yêu cầu các công ty công bố ngay sự cố liên quan đến mô hình của mình, rồi “hành động nhanh chóng, quyết liệt để khắc phục mọi thiệt hại”.
“Chậm thông báo, khắc phục không thỏa đáng và không nhận trách nhiệm sẽ không được dung thứ,” tuyên bố nhấn mạnh.
Mô hình AI của Anthropic gửi tin báo án mạng giả lên trang web cảnh sát Philadelphia
Ông Trump lập “Lực lượng Siêu trí tuệ” điều phối cuộc đua AI của chính phủ Mỹ
Tổng chưởng lý California gửi trát điều tra OpenAI về sự cố an ninh mạng liên quan AI
Nguyệt Lượng (t/h)
Từ khóa Anthropic an toàn AI Satya Nadella microsoft trí tuệ nhân tạo AI openAI nguy cơ của trí tuệ nhân tạo













![[VIDEO] “Con nhà hàng xóm”](https://trithucvn2.net/wp-content/uploads/2026/10/Con-nha-hang-xom-03-446x295.jpg)



















