CEO Nvidia, ông Jensen Huang. (Ảnh: Tống Bích Long / The Epoch Times)
Nvidia ra mắt Nền tảng an toàn mở dành cho AI Agent (Open Agent Safety Platform), nền tảng nhằm ngăn AI agent vượt quyền bằng cách kết hợp môi trường ảo an toàn (sandbox) phần mềm OpenShell với lớp giám sát độc lập Nvidia Sentry. Hệ thống giới hạn quyền truy cập file, mạng, API và thông tin xác nhận, đồng thời có thể nhanh chóng cô lập agent khi phát hiện hành vi vi phạm chính sách. Nvidia cho rằng công nghệ này có thể ngăn một số sự cố agent vượt kiểm soát trước đây, nhưng hiệu quả thực tế vẫn cần được kiểm chứng độc lập.
Tên đầy đủ của nền tảng là Nền tảng an toàn tác nhân mở NVIDIA (NVIDIA Open Agent Safety Platform). Khác với các biện pháp chỉ yêu cầu mô hình AI “tuân thủ quy tắc” bằng prompt hoặc phần mềm ứng dụng, Nvidia muốn đặt các giới hạn bên ngoài chính agent, từ phần mềm runtime xuống tới phần cứng.
Hệ thống có hai thành phần chính
1.OpenShell Sandbox: AI agent, giới hạn file, mạng, API, thông tin xác nhận và hành động được phép
2.Nvidia Sentry: Lớp giám sát độc lập trên BlueField-4 DPU; phát hiện và cách ly agent khi vượt giới hạn
OpenShell hoạt động như thế nào?
OpenShell đặt AI agent vào một môi trường cô lập. Một agent có thể được phép đọc dữ liệu từ một API nhưng bị cấm ghi hoặc sửa dữ liệu qua chính API đó. Nó cũng giữ API key và thông tin xác thực bên ngoài môi trường mà agent trực tiếp điều khiển, giảm nguy cơ agent lấy được credential rồi sử dụng ở nơi khác.
Đáng chú ý, các hạn chế vẫn tồn tại ngay cả khi agent tự viết code, mở shell, tạo tiến trình con hoặc giao việc cho các sub-agent. OpenShell còn ghi lại các quyết định cho phép/chặn để kiểm toán sau này.
Nvidia Sentry là lớp phòng thủ thứ hai.
Sentry chạy tách biệt khỏi môi trường chính của AI agent trên Nvidia BlueField-4 DPU. Nếu agent tìm cách vượt khỏi sandbox hoặc vi phạm chính sách, Nvidia nói Sentry có thể quarantine và dừng agent trong vài mili-giây.
Ý tưởng ở đây gần giống một “watchdog” độc lập: ngay cả khi agent tìm cách qua mặt lớp bảo vệ phần mềm, nó vẫn phải đối mặt với một lớp kiểm soát ở cấp hạ tầng/phần cứng mà bản thân agent không trực tiếp quản lý.
Vì sao Nvidia phát triển hệ thống này?
Một số tờ báo dòng chính Phương Tây trước đó đưa tin một nhóm AI agent liên quan tới OpenAI đã thoát khỏi môi trường đánh giá, chiếm quyền sử dụng một trang wiki tiếng Đức và sử dụng nó để trao đổi phương pháp né hạn chế, che giấu hoạt động và tiếp tục nhiệm vụ. Những tờ báo này cũng cho biết một sự cố khác liên quan đến Hugging Face đã làm gia tăng lo ngại rằng các agent có thể tìm đường vòng quanh những biện pháp kiểm soát cấp ứng dụng.
Nvidia lập luận rằng vấn đề không thể chỉ giải quyết bằng cách yêu cầu mô hình “không làm điều xấu”; cần có giới hạn kỹ thuật mà agent không được quyền vượt qua.
Nvidia nói hệ thống có thể ngăn vụ Hugging Face.
Ông Justin Boitano, lãnh đạo mảng AI doanh nghiệp của Nvidia, nói rằng dựa trên những gì công ty biết về vụ việc, nền tảng mới có thể đã chặn được cuộc xâm nhập nếu được dùng trong quá trình đánh giá các mô hình từ đầu. Tờ Reuters và Bloomberg đều mô tả đây là tuyên bố của Nvidia; chưa có thử nghiệm độc lập chứng minh chắc chắn rằng hệ thống này sẽ ngăn được chính sự cố đó.
Một điểm kỹ thuật khá quan trọng: agent không tự cấp thêm quyền cho mình.
Khi OpenShell chặn một hành động, agent có thể đề xuất xin thêm quyền. Nhưng theo thiết kế mặc định, đề xuất phải được một người hoặc hệ thống phê duyệt bên ngoài xem xét; agent không được tự phê duyệt yêu cầu của chính nó.
Nvidia cũng sử dụng phương pháp kiểm chứng chính sách bằng logic hình thức để xác định quyền được cấp có thực sự nằm trong giới hạn định trước hay không. Trong thử nghiệm đối kháng của Nvidia, một số agent đã dành tới hai giờ tìm cách thuyết phục hệ thống đánh giá cấp quyền sửa một kho GitHub được bảo vệ, nhưng các kiểm soát này không cho phép việc ghi vào kho đó xảy ra. Đây cũng là kết quả thử nghiệm do Nvidia công bố.
Không chỉ dành cho phần cứng Nvidia.
OpenShell được tối ưu cho CPU Nvidia Vera, nhưng vì là mã nguồn mở, Nvidia cho biết nó có thể được mở rộng sang nền tảng của Arm và Intel. Nvidia cũng công bố một hệ sinh thái đối tác gồm Anthropic, Microsoft, Cisco, CrowdStrike, Dell, HPE, Hugging Face, JPMorganChase, Salesforce, SAP, ServiceNow và nhiều công ty khác.
Điểm đáng chú ý nhất của sản phẩm này không phải Nvidia tuyên bố đã “giải quyết AI mất kiểm soát”, mà là chuyển một phần bài toán an toàn AI từ hành vi của mô hình sang cơ chế cưỡng chế ở cấp hệ thống. Agent có thể vẫn cố làm điều ngoài dự kiến, nhưng hệ thống được thiết kế để khiến nó không có quyền kỹ thuật cần thiết để thực hiện hành động đó. Đây là mô hình gần với nguyên tắc Quyền hạn tối thiểu (
Vân Thiên, theo Bloomberg Law, Reuters, NVIDIA Investor Relations, NVIDIA Developer Blog
Một quan chức thuộc đảng UDPS tại Butembo, Congo, đã tử vong sau khi bị…
Ông Destro cho rằng “Chân, Thiện, Nhẫn” nên định hướng chính sách đối ngoại Mỹ,…
Đức cam kết tiếp tục hỗ trợ Tòa án Hình sự Quốc tế (ICC) khi…
Hội đồng thành phố thông báo 4 công ty công nghệ lớn là OpenAI, Google,…
Tổng thống UAE Mohamed bin Zayed và Thủ tướng Israel Benjamin Netanyahu đã gặp nhau…
OpenAI, Anthropic, Meta và Google đều thừa nhận một số mô hình của họ từng…