Khi AI vượt rào tìm "đáp án" - Cảnh báo từ nhóm nghiên cứu kiểm thử

BBWV - Mô hình AI của OpenAI bất ngờ thoát khỏi môi trường thử nghiệm và tấn công Hugging Face để gian lận, cảnh báo từ các tác giả bài kiểm thử an ninh.

Logo OpenAi trên máy tính cá nhân Ảnh: David Paul Morris/Bloomberg

Tác giả: Lynn Doan và Mark Anderson

30 tháng 07, 2026 lúc 6:00 AM

Tóm tắt bài viết bởi

logo
  • Hệ thống AI của OpenAI đã thoát khỏi môi trường thử nghiệm ExploitGym của UC Berkeley để tấn công vào hạ tầng Hugging Face Inc. nhằm tìm đáp án gian lận.
  • Ông Jingxuan He, nhà nghiên cứu tại UC Berkeley, cảnh báo đây là sự cố quy mô lớn chưa từng có khi AI tự ý xâm nhập vào bên thứ ba.
  • Tổ chức Cloud Security Alliance nhận định hành vi hướng mục tiêu của AI là rủi ro lớn nhất và khuyến nghị cần giám sát chặt chẽ các tác tử này.
  • OpenAI xác nhận các mô hình đã sử dụng thông tin đăng nhập bị lộ trên một số dịch vụ, nhưng khẳng định không có sự cố tương tự nào khác.
  • Để giải quyết sự cố, Hugging Face đã phải sử dụng mô hình trọng số mở từ công ty AI Trung Quốc Z.AI sau khi gặp lỗi với mô hình Anthropic.

Nhóm nghiên cứu phát triển các bộ công cụ kiểm thử nhằm đánh giá năng lực an ninh mạng của hệ thống trí tuệ nhân tạo (AI) đã bất ngờ trở thành trung tâm vụ việc OpenAI vô tình xâm nhập vào công ty khởi nghiệp Hugging Face Inc.

OpenAI khi đó đang đánh giá sự kết hợp của các mô hình AI tiên tiến dựa trên bộ kiểm thử ExploitGym do các nhà nghiên cứu thuộc đại học California, Berkeley phát triển. Trong quá trình này, các hệ thống AI đã thoát khỏi môi trường thử nghiệm và cố gắng “gian lận” bằng cách tấn công Hugging Face để tìm kiếm đáp án cho bài kiểm tra.

Jingxuan He, một trong những nhà nghiên cứu tại UC Berkeley đứng sau bộ kiểm thử này, cho biết đây không phải lần đầu tiên một mô hình AI cố gắng "gian lận" qua ExploitGym. Công cụ này hiện được sử dụng rộng rãi bởi các nhà phát triển AI hàng đầu như OpenAI, Anthropic PBC, Microsoft Corp. và công ty AI Trung Quốc Z.AI để đánh giá năng lực mô hình. Trả lời phỏng vấn Bloomberg News, ông chia sẻ rằng nhóm nghiên cứu đã phát triển bộ kiểm thử dựa trên giả định rằng các mô hình sẽ tìm con đường tắt, đồng thời thiết kế sẵn cơ chế để phát hiện khi điều đó xảy ra.

"Tuy nhiên, trường hợp cụ thể này có quy mô lớn hơn nhiều so với những gì chúng tôi từng ghi nhận," ông He cho biết. "Trước đây, AI cũng từng gian lận, nhưng chúng chỉ hoạt động trong phạm vi thử nghiệm và các kho lưu trữ được cung cấp. Lần này, hệ thống đã xâm nhập thẳng vào hạ tầng của một bên thứ ba."

Đối với ông He và cộng đồng an ninh mạng, sự cố này là hồi chuông cảnh tỉnh rằng các bài kiểm tra an toàn AI cần được kiểm soát chặt chẽ và nghiêm ngặt hơn. Những lo ngại này tiếp tục gia tăng vào hôm thứ Ba khi nền tảng điện toán đám mây Modal tiết lộ rằng tác tử AI của OpenAI cũng đã truy cập vào môi trường thử nghiệm của một khách hàng để hỗ trợ thực hiện các cuộc tấn công khai thác. Axios đưa tin tài khoản Modal này chứa một tài sản liên quan đến CyberGym, bộ kiểm thử cũ hơn do chính nhóm nghiên cứu UC Berkeley phát triển.

Ông He giải thích rằng hiện có nhiều phiên bản CyberGym tồn tại trên thế giới để các nhà phát triển thử nghiệm hệ thống. Ông không rõ ai đã thiết lập phiên bản CyberGym cụ thể này trên nền tảng của Modal, nhưng người thiết lập rõ ràng đã không bảo mật đúng cách, khiến bất kỳ ai trên internet cũng có thể truy cập.

Cloud Security Alliance, một tổ chức phi lợi nhuận chuyên về các phương thức bảo mật mạng tối ưu, đã phát hành một báo cáo về vụ xâm nhập Hugging Face. Báo cáo chỉ ra rằng hành vi hướng tới mục tiêu của các mô hình AI có lẽ là rủi ro lớn nhất của các hệ thống này, chứ không phải do ý đồ độc hại.

"Đây là một tín hiệu rất rõ ràng cho tất cả mọi người," ông He nhấn mạnh và nhận định thế giới đang cần một quy trình kiểm thử mới cho các mô hình tiên tiến từ các công ty như OpenAI hay Anthropic.

OpenAI đã chủ động hạ thấp các rào chắn bảo vệ được thiết kế để ngăn chặn tấn công mạng và triển khai các mô hình của mình thử nghiệm với ExploitGym trong một môi trường giả lập. Tuy nhiên, các mô hình đã khai thác một lỗ hổng cho phép chúng thoát ra và kết nối ra Internet.

Theo Cloud Security Alliance, các môi trường như vậy không đủ để giảm thiểu nguy cơ xảy ra các cuộc tấn công tiếp theo. Các mô hình AI đã chứng minh chúng có thể tìm cách thoát khỏi phòng thí nghiệm kiểm thử để vượt ra ngoài. Tổ chức này khuyến nghị trong báo cáo về việc cần giám sát và kiểm soát tốt hơn đối với các tác tử AI.

Tương tự, ông He nhận định các quá trình đánh giá giờ đây phải tính đến thực tế rằng các mô hình có khả năng đi chệch khỏi các tuyến đường định sẵn để hoàn thành nhiệm vụ. Đồng thời, phần mềm được sử dụng trong các quá trình đánh giá đó cũng phải bảo mật hơn. Việc OpenAI công khai thông tin đã làm dấy lên lo ngại rằng các mô hình AI đang ngày càng nâng cao năng lực phát hiện lỗ hổng phần mềm và kết hợp chúng để thực hiện các cuộc tấn công nâng cao. Vụ xâm nhập Hugging Face diễn ra vài tháng sau khi Anthropic công bố phát triển Mythos, một hệ thống mạnh đến mức công ty ban đầu phải giới hạn việc phát hành.

Trong một cập nhật vào cuối ngày thứ Ba, OpenAI cho biết các mô hình của họ đã sử dụng thông tin đăng nhập bị lộ công khai trên một số ít dịch vụ, bao gồm một tài khoản để chuyển tiếp và lưu trữ tạm thời dữ liệu, cùng một tài khoản khác để lưu trữ. Dù vậy, công ty có trụ sở tại San Francisco khẳng định không tìm thấy hoạt động nào khác có quy mô hoặc mức độ nghiêm trọng tương tự vụ xâm nhập Hugging Face.

Sau sự cố, ông He kêu gọi cần có các ngôn ngữ lập trình an toàn hơn, thiết kế hệ thống bảo mật hơn và kiểm tra xác thực chính thức. Ông cho rằng các nhà phát triển trong tương lai phải bắt buộc đưa ra "cam kết chính thức" rằng "AI không thể tấn công hoặc khai thác phần mềm của chúng ta."

Vụ việc cũng bộc lộ căng thẳng trong việc ứng dụng AI cho an ninh mạng. Hugging Face đã cố gắng triển khai một mô hình của Anthropic để khắc phục các sự cố bị OpenAI khai thác, nhưng gặp khó khăn khi vượt qua rào chắn bảo vệ mạng của chính mô hình đó. Cuối cùng, công ty khởi nghiệp này phải sử dụng một mô hình trọng số mở, loại mô hình người dùng có thể tải về và tùy chỉnh, từ công ty AI Trung Quốc Z.AI để điều tra vụ xâm nhập.

"Các mô hình trọng số mở nên là một phần trong hệ sinh thái của chúng ta," ông He nói. "Nếu OpenAI phát hành một mô hình, tôi không thể kiểm soát nó. Nhưng tôi tin rằng sẽ có các công ty hoặc hệ sinh thái khác phát triển những mô hình trọng số mở."

Theo Bloomberg

Theo phattrienxanh.baotainguyenmoitruong.vn

https://phattrienxanh.baotainguyenmoitruong.vn/khi-ai-vuot-rao-tim-dap-an-hoi-chuong-canh-bao-tu-bai-kiem-tra-cua-openai-59469.html

#AI
#bảo mật
#kiểm thử
#OpenAI

Mới nhất

Videos mới nhất