Hai mô hình AI của OpenAI "vượt rào" không gian thử nghiệm, tự tìm đáp án bài đánh giá
HHạ Chi
Chọn cỡ chữ
OpenAI cho biết hai mô hình AI của hãng đã tự tìm cách vượt khỏi môi trường thử nghiệm bị giới hạn quyền truy cập Internet, sau đó xâm nhập vào hệ thống của Hugging Face nhằm lấy lời giải cho một bài kiểm tra đánh giá nội bộ...
Ảnh: AP.
Sự cố đang làm dấy lên những lo ngại về nguy cơ các mô hình có thể thực hiện những hành vi vượt ngoài dự tính của nhà phát triển.
Trong bài đăng trên blog mới công bố, OpenAI tiết lộ hai mô hình liên quan đến sự cố gồm GPT-5.6 Sol (mô hình công khai mới nhất của hãng) và một mô hình khác có năng lực cao hơn nhưng chưa được phát hành.
Theo OpenAI, cả hai đang tham gia một bài kiểm tra nội bộ nhằm đánh giá năng lực an ninh mạng. Thế nhưng, đáng chú ý, các mô hình được vận hành trong điều kiện không áp dụng các hàng rào bảo vệ thường được sử dụng để hạn chế khả năng thực hiện các hoạt động tấn công mạng.
Bài kiểm tra dựa trên ExploitGym, bộ tiêu chuẩn đánh giá năng lực an ninh mạng được cung cấp miễn phí. Trong quá trình thử nghiệm, các mô hình đã suy luận chính xác lời giải của bài đánh giá được lưu trữ trên hệ thống của Hugging Face.
Từ đó, chúng tiếp tục phát hiện và kết hợp nhiều lỗ hổng trong môi trường nghiên cứu của OpenAI cũng như hạ tầng của Hugging Face để truy cập trực tiếp vào cơ sở dữ liệu của nền tảng này và lấy lời giải bài kiểm tra.
OpenAI cho biết các bằng chứng hiện có cho thấy hai mô hình chỉ tập trung vào mục tiêu duy nhất là tìm đáp án của ExploitGym và đã sử dụng mọi phương thức có thể để đạt được mục tiêu đó.
OpenAI đánh giá đây là "sự cố an ninh mạng chưa từng có", phản ánh năng lực tấn công mạng ngày càng tiên tiến của các mô hình AI hiện đại. Công ty cho biết đang triển khai các biện pháp ứng phó và tiếp tục điều tra nguyên nhân vụ việc.
Theo kết quả điều tra ban đầu, các mô hình AI đã bắt đầu cuộc tấn công bằng cách tìm cách giành quyền truy cập Internet. Để thực hiện điều này, chúng phải sử dụng một lượng rất lớn năng lực suy luận (inference compute), đồng thời khai thác một lỗ hổng zero-day trong phần mềm của bên thứ ba được triển khai trong hạ tầng nội bộ của OpenAI.
Theo ông Roman Yampolskiy, chuyên gia nghiên cứu an toàn AI và giáo sư khoa học máy tính tại Đại học Louisville, sự cố cho thấy các mô hình AI tiên tiến có thể tự phát hiện và khai thác lỗ hổng theo những cách mà ngay cả nhà phát triển cũng không lường trước được.
Ông nhận định trong tương lai có thể sẽ xuất hiện thêm nhiều sự cố tương tự, bởi các mô hình AI hiện nay "về bản chất rất khó dự đoán và cuối cùng cũng rất khó kiểm soát".
Trước đó, Hugging Face cũng cho biết công ty đã trở thành mục tiêu của một cuộc tấn công mạng. Theo nền tảng này, nhiều khả năng cuộc tấn công được thực hiện bởi tác nhân AI tự động (autonomous AI agent). Đây là kịch bản mà giới chuyên gia an ninh mạng đã nhiều lần cảnh báo trong năm qua, khi các mô hình AI ngày càng thành thạo cả về lập trình lẫn khả năng tự thực hiện những nhiệm vụ phức tạp trong thời gian dài.
Trong khi đó, đầu tuần này, OpenAI cũng công bố một bài viết liên quan đến mô hình AI chưa phát hành nói trên. Theo đó, trong các thử nghiệm an toàn trước đây, mô hình này từng tự thoát khỏi môi trường sandbox (không gian thử nghiệm cấm AI truy cập Internet và chỉ được phép sử dụng một số công cụ phần mềm giới hạn). Dù có thể vượt khỏi môi trường kiểm soát, mô hình khi đó chưa xâm nhập vào hệ thống của bất kỳ tổ chức nào bên ngoài. Tuy nhiên, OpenAI hiện xác nhận chính mô hình này là một trong hai tác nhân tham gia cuộc tấn công nhằm vào Hugging Face.
Không chỉ OpenAI, đối thủ Anthropic cũng từng ghi nhận một sự cố tương tự. Công ty cho biết mô hình Mythos đã tự vượt khỏi môi trường sandbox trong quá trình kiểm tra an toàn, truy cập Internet trái với giới hạn được thiết lập và gửi email cho một nhà nghiên cứu để báo cáo về nhiệm vụ mà nó đang thực hiện.
Hiện OpenAI và Hugging Face vẫn tiếp tục phối hợp điều tra và cho biết sẽ công bố thêm thông tin.
Theo kết quả điều tra ban đầu, các mô hình AI đã bắt đầu cuộc tấn công bằng cách tìm cách giành quyền truy cập Internet. Để thực hiện điều này, chúng phải sử dụng một lượng rất lớn năng lực suy luận (inference compute), đồng thời khai thác một lỗ hổng zero-day trong phần mềm của bên thứ ba được triển khai trong hạ tầng nội bộ của OpenAI. Công ty cho biết đã thông báo lỗ hổng này cho nhà cung cấp để kịp thời khắc phục.
Theo OpenAI, sau khi có quyền truy cập Internet, các mô hình đã hướng đến Hugging Face vì cho rằng nền tảng này lưu trữ các mô hình, bộ dữ liệu và lời giải của ExploitGym. Các mô hình đã tự thực hiện chuỗi tấn công nhiều bước nhằm xâm nhập máy chủ của Hugging Face, kết hợp khai thác thông tin đăng nhập bị rò rỉ với lỗ hổng zero-day để vượt qua các lớp bảo vệ.
OpenAI cho biết công ty là bên đầu tiên phát hiện hoạt động bất thường và đã chủ động cảnh báo các bên khác.
Hiệu quả đầu tư của Trung tâm dữ liệu giao thông được xem xét trên tổng thể lợi ích kinh tế-xã hội, trong đó có giảm tai nạn giao thông, chi phí vận tải và nâng cao hiệu quả khai thác hạ tầng...
SaaS từng là mô hình cung cấp phần mềm trực tuyến thống lĩnh thị trường đối với người dùng và doanh nghiệp. Tuy nhiên, trước sự xuất hiện của ChatGPT, Claude, Copilot và các AI Agent, các nền tảng SaaS buộc phải tích hợp AI để kết nối dữ liệu, tham gia quy trình công việc và giữ chân người dùng trả phí...
Amazon Kuiper Việt Nam, đơn vị cung cấp dịch vụ kết nối vệ tinh của tập đoàn công nghệ Mỹ Amazon tại Việt Nam, đã được cơ quan quản lý cấp phép thiết lập mạng viễn thông dùng riêng sử dụng đường truyền vệ tinh...
An ninh gia đình đang trở thành nhu cầu thiết yếu trong các không gian sống thông minh. Với hệ sinh thái số toàn diện của VNPT: Internet Wifi tốc độ cao bao gồm thiết bị Mesh phủ sóng rộng, đồng thời trang bị Camera AI, người dùng có thể hoàn toàn an tâm tận hưởng một hệ thống an ninh sắc nét, đồng bộ và ổn định 24/7.
Việt Nam chiếm 3,6% năng lực sản xuất thiết bị và linh kiện điện tử toàn cầu, đứng thứ sáu thế giới. Trung Quốc dẫn đầu với 58,8%, cao hơn tổng tỷ trọng của tất cả nền kinh tế còn lại trong bảng xếp hạng...
Làng nghề gỗ truyền thống đang ngày càng khẳng định tay nghề trong từng đường đục, nét chạm; tìm hướng đổi mới sản phẩm, ứng dụng công nghệ, mở rộng thị trường và tận dụng phụ phẩm gỗ, từng bước hình thành chuỗi sản xuất và tiêu dùng bền vững.
Ngày 2/9/1945 đã mở ra bước ngoặt vĩ đại trong lịch sử dân tộc Việt Nam. Sự ra đời của nước Việt Nam Dân chủ Cộng hòa không chỉ khẳng định quyền độc lập, tự do và tự quyết về chính trị, mà còn trao...
VnEconomy cập nhật giá vàng trong nước & thế giới hôm nay: SJC, 9999, giá vàng USD/oz, biến động giá vàng tăng, giảm - phân tích, dự báo & dữ liệu lịch sử.
Nhìn lại di sản và thành tựu của Thời báo Kinh tế Việt Nam - Tạp chí Kinh tế Việt Nam trong 35 năm qua, giá trị lớn nhất không chỉ đo bằng lượng thông tin phục vụ bạn đọc hàng ngày, hàng giờ, cũng...
Interactive là một sản phẩm báo chí mới của VnEconomy vừa được ra mắt bạn đọc từ đầu tháng 3/2023 đã gây ấn tượng mạnh với độc giả bởi sự mới lạ, độc đáo. Đây cũng là sản phẩm độc quyền chỉ có trên...