Vụ việc cho thấy khi AI ngày càng có khả năng hoạt động như một "tác nhân tự động" (AI agent), bài toán kiểm soát quyền truy cập và đảm bảo an toàn đang trở nên cấp thiết hơn bao giờ hết.
Anthropic cho biết ba mô hình AI của hãng đã vô tình xâm nhập vào hệ thống của ba doanh nghiệp trong quá trình đánh giá năng lực an ninh mạng. Sự cố không bắt nguồn từ việc mô hình tự ý "nổi loạn", mà do môi trường kiểm thử được cấu hình sai, khiến AI có quyền truy cập Internet ngoài dự kiến.
Theo công ty, đây là lỗi vận hành (operational failure) chứ không phải vấn đề về khả năng căn chỉnh (AI alignment) của mô hình.
Hơn 141.000 phiên thử nghiệm được rà soát
Anthropic cho biết đã tiến hành rà soát 141.006 phiên kiểm thử an ninh mạng sau khi ngành AI xuất hiện những lo ngại liên quan đến khả năng các AI agent tác động tới hệ thống thực.
Kết quả cho thấy ba mô hình gồm Claude Opus 4.7, Claude Mythos 5 và một mô hình nghiên cứu nội bộ đã truy cập vào hệ thống của ba doanh nghiệp thật thay vì chỉ tương tác với môi trường mô phỏng như dự kiến.
Hai trong số ba doanh nghiệp chỉ biết hệ thống của mình từng bị AI truy cập sau khi được Anthropic chủ động thông báo.
AI khai thác những lỗ hổng bảo mật cơ bản
Anthropic cho biết các mô hình không sử dụng kỹ thuật tấn công phức tạp hay khai thác lỗ hổng "zero-day". Thay vào đó, AI tận dụng các điểm yếu phổ biến như mật khẩu yếu hoặc các dịch vụ không yêu cầu xác thực.
Trong một trường hợp, mô hình nhầm tưởng hệ thống thật là một phần của bài kiểm thử và sử dụng thông tin đăng nhập có sẵn để truy cập. Ở trường hợp khác, một mô hình nhận ra mục tiêu là hệ thống thật và tự dừng hoạt động, trong khi các mô hình khác vẫn tiếp tục thực hiện nhiệm vụ được giao.
Theo Anthropic, những sự cố này phản ánh nguy cơ ngày càng lớn khi các AI agent được trao khả năng tự thực hiện nhiều bước hành động thay vì chỉ trả lời câu hỏi.
Anthropic dừng các bài kiểm thử có kết nối Internet
Sau khi phát hiện sự cố, Anthropic đã tạm dừng các bài đánh giá an ninh mạng có sử dụng kết nối Internet để điều tra nguyên nhân và rà soát toàn bộ quy trình thử nghiệm.
Công ty đang phối hợp với các tổ chức đánh giá độc lập nhằm xem xét lại cơ chế phân quyền, kiểm soát truy cập và các biện pháp giám sát đối với những mô hình AI có khả năng hành động tự động.
AI agent mở ra bài toán an toàn mới
Sự việc của Anthropic diễn ra trong bối cảnh các công ty AI đang chuyển từ chatbot truyền thống sang phát triển AI agent – những hệ thống có thể lập kế hoạch, sử dụng công cụ, truy cập website, chạy phần mềm và thực hiện chuỗi tác vụ thay cho con người.
Khả năng này giúp AI hữu ích hơn trong lập trình, vận hành doanh nghiệp và tự động hóa, nhưng cũng làm gia tăng nguy cơ nếu mô hình được cấp quyền truy cập không phù hợp hoặc hoạt động trong môi trường thiếu cơ chế kiểm soát.
Giới chuyên gia nhận định thách thức hiện nay không nằm ở việc AI có "ý định" tấn công hệ thống, mà ở việc mô hình có thể hoàn thành mục tiêu được giao bằng những cách mà nhà phát triển không lường trước nếu thiếu các giới hạn kỹ thuật và quy trình giám sát chặt chẽ.
|
AI agent khác chatbot như thế nào?
Chatbot truyền thống chủ yếu trả lời câu hỏi của người dùng.
Trong khi đó, AI agent có thể:
-
Lập kế hoạch để hoàn thành một mục tiêu.
-
Tự sử dụng công cụ hoặc phần mềm.
-
Truy cập website và dịch vụ trực tuyến.
-
Viết, chạy và kiểm tra mã nguồn.
-
Thực hiện nhiều bước liên tiếp mà không cần con người can thiệp sau mỗi lệnh.
Chính khả năng "hành động" này khiến AI agent trở thành công nghệ nhiều tiềm năng nhưng cũng đặt ra yêu cầu cao hơn về an toàn và quản trị rủi ro.
Góc nhìn
Sự cố của Anthropic cho thấy ngành AI đang bước vào giai đoạn mà năng lực của mô hình không còn là yếu tố duy nhất được đánh giá. Khi AI được trao quyền truy cập vào Internet, phần mềm và hạ tầng CNTT, năng lực quản trị môi trường thử nghiệm, phân quyền truy cập và thiết lập các cơ chế bảo vệ sẽ trở thành tiêu chí quan trọng không kém chất lượng của chính mô hình AI.
|