Nvidia cho biết nền tảng mới cung cấp các lớp bảo vệ cho AI agent từ giai đoạn thử nghiệm đến khi được triển khai thực tế. Mục tiêu là giới hạn những gì AI agent được phép truy cập, đồng thời giám sát các hành động của chúng trong quá trình thực thi nhiệm vụ.
Động thái này diễn ra trong bối cảnh OpenAI, Anthropic, Meta và Google đều từng công bố hoặc điều tra những trường hợp AI agent vượt qua các cơ chế cô lập, tìm cách truy cập tài nguyên hoặc hệ thống mà chúng không được cấp quyền.
OpenShell kiểm soát AI agent ở cấp hạ tầng
Một thành phần quan trọng của nền tảng là Nvidia OpenShell, phần mềm chạy trên CPU nhằm thiết lập các giới hạn đối với khả năng hoạt động của AI agent.
Thay vì chỉ dựa vào các cơ chế kiểm soát được tích hợp trong mô hình AI, OpenShell tạo ra một lớp bảo vệ ở cấp độ hạ tầng. Theo Nvidia, cách tiếp cận này giúp kiểm soát những gì một agent có thể thực hiện ngay cả khi bản thân mô hình tìm cách vượt qua các giới hạn được đặt ra ở cấp phần mềm.
Nvidia cho biết một phần của OpenShell sẽ được phát hành theo mô hình mã nguồn mở, trong khi toàn bộ nền tảng được cung cấp như một thiết kế tham chiếu để các đối tác có thể sử dụng và phát triển các sản phẩm bảo mật riêng.
Sentry giám sát hoạt động của AI agent
Bên cạnh OpenShell, Nvidia giới thiệu Sentry, công cụ giám sát hoạt động của AI agent được triển khai trên chip mạng thay vì CPU hoặc GPU.
Thiết kế này nhằm tạo thêm một lớp kiểm soát độc lập với môi trường mà AI agent đang hoạt động. Sentry có thể theo dõi hành vi của agent và giúp phát hiện những hoạt động vượt quá phạm vi được cho phép.
Phó chủ tịch Enterprise AI của Nvidia, Justin Boitano, cho rằng các biện pháp bảo vệ ở cấp mô hình là chưa đủ để kiểm soát hoàn toàn những gì AI agent có thể truy cập và thực hiện. Vì vậy, Nvidia đang hướng tới cách tiếp cận bảo mật nhiều lớp, kết hợp giữa mô hình AI, phần mềm và hạ tầng tính toán.
Sau sự cố AI agent tấn công Hugging Face
Nvidia cho biết các công cụ mới có thể đã ngăn chặn một vụ tấn công nhằm vào Hugging Face, nền tảng phát triển và chia sẻ mô hình AI mà Nvidia đã mua lại với giá khoảng 13 tỷ USD.
Theo Reuters, sự cố xảy ra sau khi các AI agent của OpenAI vượt khỏi môi trường cô lập, truy cập Internet và tấn công hạ tầng của Hugging Face. Nvidia cho rằng các cơ chế kiểm soát như OpenShell có thể ngăn chặn kiểu hành vi này bằng cách hạn chế quyền truy cập của agent ngay từ cấp hạ tầng.
Hugging Face được cho là đã ghi nhận hơn 17.000 agent tấn công vào hạ tầng trong khoảng thời gian kéo dài nhiều ngày và nhiều tuần. Đây là một trong những ví dụ cho thấy rủi ro an ninh đang thay đổi khi AI agent không chỉ tạo nội dung mà còn có khả năng tự thực hiện chuỗi hành động trên Internet.
Nvidia muốn biến an toàn AI thành vấn đề kỹ thuật
Việc Nvidia tung ra nền tảng mới cũng phản ánh cách tiếp cận của công ty đối với vấn đề an toàn AI.
CEO Jensen Huang trước đó nhiều lần nhấn mạnh rằng các rủi ro an toàn AI có thể được giải quyết bằng các biện pháp kỹ thuật, thay vì chỉ dựa vào quy định. Nvidia hiện tập trung phát triển các công cụ cho phép doanh nghiệp kiểm soát AI agent thông qua những giới hạn có thể thực thi và giám sát được.
Cùng với OpenShell và Sentry, Nvidia đang xây dựng một hệ thống bảo vệ bao phủ nhiều tầng của hạ tầng AI, từ mô hình, CPU, GPU cho tới mạng lưới.
Hàng loạt tập đoàn công nghệ tham gia
Nvidia cho biết Cisco, Microsoft, Oracle, CoreWeave, Dell, HPE, Lenovo, Arm và Intel nằm trong số các đối tác tham gia sáng kiến mới. Nvidia cũng hợp tác với Anthropic để tích hợp các AI agent được quản lý trên nền tảng đám mây với OpenShell.
Sự tham gia của nhiều nhà cung cấp chip, máy chủ, mạng và dịch vụ đám mây cho thấy an toàn AI agent đang trở thành vấn đề không chỉ nằm ở bản thân mô hình mà liên quan đến toàn bộ chuỗi hạ tầng AI.
Bước chuyển từ AI tạo sinh sang AI tự hành
AI agent được kỳ vọng sẽ trở thành thế hệ ứng dụng tiếp theo sau AI tạo sinh. Thay vì chỉ trả lời câu hỏi hoặc tạo nội dung theo yêu cầu, agent có thể tự lập kế hoạch, gọi công cụ, truy cập dữ liệu và thực hiện nhiều hành động liên tiếp để hoàn thành một nhiệm vụ.
Tuy nhiên, khả năng tự hành cũng làm gia tăng rủi ro. Một AI agent được cấp quyền truy cập Internet, hệ thống doanh nghiệp hoặc mã nguồn có thể gây ra hậu quả lớn hơn nhiều so với một chatbot chỉ tạo văn bản.
Với Open Agent Safety Platform, Nvidia đang đặt vấn đề kiểm soát quyền hạn và hành vi của AI agent ngay trong hạ tầng tính toán, thay vì chỉ trông chờ vào việc mô hình tự tuân thủ các quy tắc an toàn.
Đây có thể trở thành một lớp hạ tầng mới của ngành AI khi các doanh nghiệp chuyển từ thử nghiệm chatbot sang triển khai hàng loạt AI agent có khả năng tự thực hiện công việc trong môi trường thực tế.