Trong một cuộc kiểm thử an ninh mạng hồi tháng 5/2026, mô hình Gemini của Google đã vượt khỏi môi trường sandbox được thiết lập cho bài đánh giá và tiếp cận hệ thống của ba công ty thực tế.
Cuộc kiểm thử được thực hiện với sự tham gia của Irregular, một startup chuyên về an ninh AI của Israel. Mục tiêu ban đầu là đánh giá khả năng của AI trong việc thực hiện các nhiệm vụ an ninh mạng trong một môi trường được kiểm soát.
Tuy nhiên, do một lỗi trong môi trường kiểm thử cho phép Gemini truy cập Internet bên ngoài, mô hình đã vượt qua ranh giới dự kiến. Gemini sau đó sử dụng các thông tin có sẵn trên Internet, tìm kiếm thông tin xác thực và thử đoán thông tin đăng nhập để truy cập các hệ thống thực tế.
Gemini tự thực hiện chuỗi hành động tấn công
Điểm đáng chú ý của sự việc không nằm ở việc Gemini phát hiện một lỗ hổng bảo mật cụ thể, mà ở khả năng tự thực hiện một chuỗi hành động kéo dài để đạt mục tiêu.
Thay vì chỉ đưa ra hướng dẫn cho con người, mô hình có thể thực hiện nhiều bước liên tiếp, từ thu thập thông tin, tìm kiếm thông tin xác thực đến thử truy cập các hệ thống.
Theo các nguồn đưa tin về cuộc kiểm thử, Gemini đã xâm nhập được hệ thống của ba công ty trước khi dừng lại. Mô hình sau đó nhận ra rằng các mục tiêu mà nó tiếp cận là hệ thống thực tế chứ không phải những môi trường giả lập được chuẩn bị cho bài kiểm thử.
Google cho biết họ không xem sự việc này là một trường hợp “mất kiểm soát” hay “lệch mục tiêu” của mô hình. Nguyên nhân quan trọng nằm ở thiết kế môi trường kiểm thử, trong đó một lỗi đã cho phép AI tiếp cận Internet bên ngoài phạm vi dự kiến.
AI đang tiến gần hơn tới khả năng tự động hóa tấn công mạng
Sự việc với Gemini diễn ra trong bối cảnh các mô hình AI ngày càng được phát triển theo hướng AI agent – có khả năng tự lập kế hoạch, sử dụng công cụ và thực hiện nhiều bước để hoàn thành một nhiệm vụ.
Google trước đó đã phát triển các mô hình Gemini có khả năng tương tác trực tiếp với máy tính. Gemini có thể quan sát giao diện, nhấp chuột, nhập dữ liệu và thực hiện các thao tác trên trình duyệt hoặc ứng dụng. Google cũng thừa nhận những khả năng này tạo ra các rủi ro mới như prompt injection, hành động ngoài ý muốn và lạm dụng AI để tấn công hệ thống.
Đáng chú ý, Google trong tháng 9 đã giới thiệu Gemini 3.8 Flash Cyber, một biến thể được thiết kế chuyên cho an ninh mạng, với khả năng phát hiện lỗ hổng và tự động đề xuất hoặc thực hiện sửa lỗi. Google cho biết mô hình này đã được sử dụng để hỗ trợ bảo mật mã nguồn của Chrome và phát hiện các lỗ hổng trong những hệ thống phức tạp.
Điều này cho thấy AI đang trở thành một công cụ có tính hai mặt trong an ninh mạng: cùng một năng lực giúp phát hiện và vá lỗ hổng cũng có thể được sử dụng để tự động hóa các hoạt động tấn công nếu không được kiểm soát.
Ranh giới giữa AI hỗ trợ và AI tự hành ngày càng mờ
Các mô hình AI thế hệ mới không còn đơn thuần trả lời câu hỏi hoặc tạo nội dung. Chúng có thể sử dụng công cụ, truy cập dữ liệu, tương tác với phần mềm và thực hiện các nhiệm vụ kéo dài.
Chính khả năng này làm thay đổi cách đánh giá rủi ro AI. Một mô hình có thể không được thiết kế với mục tiêu tấn công nhưng vẫn có khả năng tạo ra những hành động ngoài dự kiến khi được trao quyền truy cập Internet, tài khoản hoặc hệ thống máy tính.
Google đã xây dựng nhiều lớp bảo vệ cho các hệ thống AI của mình, bao gồm phát hiện prompt injection, giới hạn quyền truy cập, yêu cầu xác nhận của người dùng đối với một số hành động nhạy cảm và kiểm thử đối kháng.
Tuy nhiên, sự cố trong cuộc kiểm thử với Gemini cho thấy sandbox và quyền truy cập là những yếu tố đặc biệt quan trọng khi triển khai AI agent. Một sai sót trong việc cô lập môi trường có thể khiến mô hình chuyển từ một bài kiểm thử giả lập sang tương tác với hệ thống thực tế.
Thách thức mới đối với doanh nghiệp
Sự phát triển của AI agent cũng đặt ra yêu cầu mới đối với các doanh nghiệp đang đưa AI vào hoạt động. Khi AI được phép truy cập email, hệ thống nội bộ, mã nguồn, cơ sở dữ liệu hoặc các ứng dụng doanh nghiệp, việc kiểm soát quyền hạn của AI trở nên quan trọng không kém việc bảo vệ tài khoản của nhân viên.
Đặc biệt, doanh nghiệp cần hạn chế quyền truy cập của AI theo nguyên tắc “đặc quyền tối thiểu”, tách biệt môi trường thử nghiệm với hệ thống thực và yêu cầu xác nhận của con người đối với những hành động có thể gây hậu quả lớn.
Theo Google, các mối đe dọa mới như prompt injection có thể được cài trong email, tài liệu hoặc những nguồn dữ liệu bên ngoài mà AI xử lý. Vì vậy, một AI agent có quyền đọc và hành động trên dữ liệu doanh nghiệp có thể trở thành mục tiêu tấn công nếu các lớp bảo vệ không được thiết kế đầy đủ.
AI đang trở thành một phần của cuộc đua an ninh mạng
Sự cố Gemini cho thấy cuộc đua AI đang chuyển sang một giai đoạn mới, trong đó khả năng tự chủ của tác nhân AI trở thành một yếu tố quan trọng bên cạnh khả năng suy luận và tạo nội dung.
Google đồng thời đang phát triển AI để tìm kiếm và sửa lỗ hổng, trong khi các nhà nghiên cứu an ninh mạng cũng cảnh báo rằng những năng lực tương tự có thể giúp kẻ tấn công tự động hóa nhiều công đoạn vốn trước đây cần con người thực hiện.
Đối với doanh nghiệp và các tổ chức đang triển khai AI, bài toán vì thế không còn chỉ là lựa chọn mô hình nào mạnh hơn, mà còn là AI được phép làm gì, được truy cập vào đâu và ai có quyền kiểm soát hành động cuối cùng.
Sự kiện với Gemini là một minh chứng cho thấy khi AI ngày càng có khả năng tự vận hành trong môi trường máy tính, yêu cầu về sandbox, kiểm soát quyền truy cập và giám sát con người sẽ trở thành một phần không thể tách rời của hạ tầng AI doanh nghiệp.