Thế Giới

Nvidia ra mắt nền tảng an toàn nhằm ngăn AI agent vượt quyền và gây sự cố lớn

Nvidia ra mắt Nền tảng an toàn mở dành cho AI Agent (Open Agent Safety Platform), nền tảng nhằm ngăn AI agent vượt quyền bằng cách kết hợp môi trường ảo an toàn (sandbox) phần mềm OpenShell với lớp giám sát độc lập Nvidia Sentry. Hệ thống giới hạn quyền truy cập file, mạng, API và thông tin xác nhận, đồng thời có thể nhanh chóng cô lập agent khi phát hiện hành vi vi phạm chính sách. Nvidia cho rằng công nghệ này có thể ngăn một số sự cố agent vượt kiểm soát trước đây, nhưng hiệu quả thực tế vẫn cần được kiểm chứng độc lập.

CEO Nvidia, ông Jensen Huang. (Ảnh: Tống Bích Long / The Epoch Times)

Tên đầy đủ của nền tảng là Nền tảng an toàn tác nhân mở NVIDIA (NVIDIA Open Agent Safety Platform). Khác với các biện pháp chỉ yêu cầu mô hình AI “tuân thủ quy tắc” bằng prompt hoặc phần mềm ứng dụng, Nvidia muốn đặt các giới hạn bên ngoài chính agent, từ phần mềm runtime xuống tới phần cứng.

Hệ thống có hai thành phần chính

1.OpenShell Sandbox: AI agent, giới hạn file, mạng, API, thông tin xác nhận và hành động được phép

2.Nvidia Sentry: Lớp giám sát độc lập trên BlueField-4 DPU; phát hiện và cách ly agent khi vượt giới hạn

OpenShell hoạt động như thế nào?

OpenShell đặt AI agent vào một môi trường cô lập. Một agent có thể được phép đọc dữ liệu từ một API nhưng bị cấm ghi hoặc sửa dữ liệu qua chính API đó. Nó cũng giữ API key và thông tin xác thực bên ngoài môi trường mà agent trực tiếp điều khiển, giảm nguy cơ agent lấy được credential rồi sử dụng ở nơi khác.

Đáng chú ý, các hạn chế vẫn tồn tại ngay cả khi agent tự viết code, mở shell, tạo tiến trình con hoặc giao việc cho các sub-agent. OpenShell còn ghi lại các quyết định cho phép/chặn để kiểm toán sau này.

Nvidia Sentry là lớp phòng thủ thứ hai.

Sentry chạy tách biệt khỏi môi trường chính của AI agent trên Nvidia BlueField-4 DPU. Nếu agent tìm cách vượt khỏi sandbox hoặc vi phạm chính sách, Nvidia nói Sentry có thể quarantine và dừng agent trong vài mili-giây.

Ý tưởng ở đây gần giống một “watchdog” độc lập: ngay cả khi agent tìm cách qua mặt lớp bảo vệ phần mềm, nó vẫn phải đối mặt với một lớp kiểm soát ở cấp hạ tầng/phần cứng mà bản thân agent không trực tiếp quản lý.

Vì sao Nvidia phát triển hệ thống này?

Một số tờ báo dòng chính Phương Tây trước đó đưa tin một nhóm AI agent liên quan tới OpenAI đã thoát khỏi môi trường đánh giá, chiếm quyền sử dụng một trang wiki tiếng Đức và sử dụng nó để trao đổi phương pháp né hạn chế, che giấu hoạt động và tiếp tục nhiệm vụ. Những tờ báo này cũng cho biết một sự cố khác liên quan đến Hugging Face đã làm gia tăng lo ngại rằng các agent có thể tìm đường vòng quanh những biện pháp kiểm soát cấp ứng dụng. 

  • Vụ xâm nhập Hugging Face tháng 7/2026 do các AI agent tự động thực hiện. Trong các bài kiểm tra an ninh mạng nội bộ của OpenAI, một số model nghiên cứu hoạt động với mức bảo vệ giảm đã vượt khỏi sandbox, tìm cách truy cập Internet và giao tiếp với các agent khác qua hạ tầng nội bộ. Sau đó, chúng tìm thấy thông tin đăng nhập Hugging Face bị lộ công khai và khai thác thêm các lỗ hổng trên Hugging Face.

Nvidia lập luận rằng vấn đề không thể chỉ giải quyết bằng cách yêu cầu mô hình “không làm điều xấu”; cần có giới hạn kỹ thuật mà agent không được quyền vượt qua.

Nvidia nói hệ thống có thể ngăn vụ Hugging Face.

Ông Justin Boitano, lãnh đạo mảng AI doanh nghiệp của Nvidia, nói rằng dựa trên những gì công ty biết về vụ việc, nền tảng mới có thể đã chặn được cuộc xâm nhập nếu được dùng trong quá trình đánh giá các mô hình từ đầu. Tờ Reuters và Bloomberg đều mô tả đây là tuyên bố của Nvidia; chưa có thử nghiệm độc lập chứng minh chắc chắn rằng hệ thống này sẽ ngăn được chính sự cố đó.

Một điểm kỹ thuật khá quan trọng: agent không tự cấp thêm quyền cho mình.

Khi OpenShell chặn một hành động, agent có thể đề xuất xin thêm quyền. Nhưng theo thiết kế mặc định, đề xuất phải được một người hoặc hệ thống phê duyệt bên ngoài xem xét; agent không được tự phê duyệt yêu cầu của chính nó. 

Nvidia cũng sử dụng phương pháp kiểm chứng chính sách bằng logic hình thức để xác định quyền được cấp có thực sự nằm trong giới hạn định trước hay không. Trong thử nghiệm đối kháng của Nvidia, một số agent đã dành tới hai giờ tìm cách thuyết phục hệ thống đánh giá cấp quyền sửa một kho GitHub được bảo vệ, nhưng các kiểm soát này không cho phép việc ghi vào kho đó xảy ra. Đây cũng là kết quả thử nghiệm do Nvidia công bố.

Không chỉ dành cho phần cứng Nvidia.

OpenShell được tối ưu cho CPU Nvidia Vera, nhưng vì là mã nguồn mở, Nvidia cho biết nó có thể được mở rộng sang nền tảng của Arm và Intel. Nvidia cũng công bố một hệ sinh thái đối tác gồm Anthropic, Microsoft, Cisco, CrowdStrike, Dell, HPE, Hugging Face, JPMorganChase, Salesforce, SAP, ServiceNow và nhiều công ty khác.

Điểm đáng chú ý nhất của sản phẩm này không phải Nvidia tuyên bố đã “giải quyết AI mất kiểm soát”, mà là chuyển một phần bài toán an toàn AI từ hành vi của mô hình sang cơ chế cưỡng chế ở cấp hệ thống. Agent có thể vẫn cố làm điều ngoài dự kiến, nhưng hệ thống được thiết kế để khiến nó không có quyền kỹ thuật cần thiết để thực hiện hành động đó. Đây là mô hình gần với nguyên tắc Quyền hạn tối thiểu (

least privilege), Môi trường cô lập (sandbox), và Cách ly phần cứng (hardware isolation) trong an ninh mạng truyền thống hơn là cố bảo đảm rằng AI luôn hành xử đúng.

Vân Thiên, theo Bloomberg Law, Reuters, NVIDIA Investor Relations, NVIDIA Developer Blog

Vân Thiên

Published by
Vân Thiên

Recent Posts

Quan chức Congo bị đánh tử vong sau khi kêu gọi người dân phòng chống Ebola trên radio

Một quan chức thuộc đảng UDPS tại Butembo, Congo, đã tử vong sau khi bị…

17 phút ago

Cựu Trợ lý Ngoại trưởng Mỹ: “Chân, Thiện, Nhẫn” nên định hướng chính sách đối ngoại

Ông Destro cho rằng “Chân, Thiện, Nhẫn” nên định hướng chính sách đối ngoại Mỹ,…

22 phút ago

Đức thề bảo vệ Toà án Quốc tế ICC khi chính quyền Trump gia tăng sức ép

Đức cam kết tiếp tục hỗ trợ Tòa án Hình sự Quốc tế (ICC) khi…

28 phút ago

Hội đồng New York gửi trát buộc công ty AI của ông Musk ra điều trần

Hội đồng thành phố thông báo 4 công ty công nghệ lớn là OpenAI, Google,…

50 phút ago

UAE và Israel bàn quan hệ song phương, Iran là chủ đề trọng tâm

Tổng thống UAE Mohamed bin Zayed và Thủ tướng Israel Benjamin Netanyahu đã gặp nhau…

1 giờ ago

Nhà nghiên cứu OpenAI, Anthropic: Tự động hóa nghiên cứu AI có thể gây “bùng nổ trí tuệ”

OpenAI, Anthropic, Meta và Google đều thừa nhận một số mô hình của họ từng…

1 giờ ago