Hai mô hình AI của OpenAI "vượt rào" không gian thử nghiệm, tự tìm đáp án bài đánh giá

OpenAI cho biết hai mô hình AI của hãng đã tự tìm cách vượt khỏi môi trường thử nghiệm bị giới hạn quyền truy cập Internet, sau đó xâm nhập vào hệ thống của Hugging Face nhằm lấy lời giải cho một bài kiểm tra đánh giá nội bộ...

Ảnh: AP.
Ảnh: AP.

Sự cố đang làm dấy lên những lo ngại về nguy cơ các mô hình có thể thực hiện những hành vi vượt ngoài dự tính của nhà phát triển.

Trong bài đăng trên blog mới công bố, OpenAI tiết lộ hai mô hình liên quan đến sự cố gồm GPT-5.6 Sol (mô hình công khai mới nhất của hãng) và một mô hình khác có năng lực cao hơn nhưng chưa được phát hành.

Theo OpenAI, cả hai đang tham gia một bài kiểm tra nội bộ nhằm đánh giá năng lực an ninh mạng. Thế nhưng, đáng chú ý, các mô hình được vận hành trong điều kiện không áp dụng các hàng rào bảo vệ thường được sử dụng để hạn chế khả năng thực hiện các hoạt động tấn công mạng.

Bài kiểm tra dựa trên ExploitGym, bộ tiêu chuẩn đánh giá năng lực an ninh mạng được cung cấp miễn phí. Trong quá trình thử nghiệm, các mô hình đã suy luận chính xác lời giải của bài đánh giá được lưu trữ trên hệ thống của Hugging Face.

Từ đó, chúng tiếp tục phát hiện và kết hợp nhiều lỗ hổng trong môi trường nghiên cứu của OpenAI cũng như hạ tầng của Hugging Face để truy cập trực tiếp vào cơ sở dữ liệu của nền tảng này và lấy lời giải bài kiểm tra.

OpenAI cho biết các bằng chứng hiện có cho thấy hai mô hình chỉ tập trung vào mục tiêu duy nhất là tìm đáp án của ExploitGym và đã sử dụng mọi phương thức có thể để đạt được mục tiêu đó.

OpenAI đánh giá đây là "sự cố an ninh mạng chưa từng có", phản ánh năng lực tấn công mạng ngày càng tiên tiến của các mô hình AI hiện đại. Công ty cho biết đang triển khai các biện pháp ứng phó và tiếp tục điều tra nguyên nhân vụ việc.

Theo kết quả điều tra ban đầu, các mô hình AI đã bắt đầu cuộc tấn công bằng cách tìm cách giành quyền truy cập Internet. Để thực hiện điều này, chúng phải sử dụng một lượng rất lớn năng lực suy luận (inference compute), đồng thời khai thác một lỗ hổng zero-day trong phần mềm của bên thứ ba được triển khai trong hạ tầng nội bộ của OpenAI.

Theo ông Roman Yampolskiy, chuyên gia nghiên cứu an toàn AI và giáo sư khoa học máy tính tại Đại học Louisville, sự cố cho thấy các mô hình AI tiên tiến có thể tự phát hiện và khai thác lỗ hổng theo những cách mà ngay cả nhà phát triển cũng không lường trước được.

Ông nhận định trong tương lai có thể sẽ xuất hiện thêm nhiều sự cố tương tự, bởi các mô hình AI hiện nay "về bản chất rất khó dự đoán và cuối cùng cũng rất khó kiểm soát".

Trước đó, Hugging Face cũng cho biết công ty đã trở thành mục tiêu của một cuộc tấn công mạng. Theo nền tảng này, nhiều khả năng cuộc tấn công được thực hiện bởi tác nhân AI tự động (autonomous AI agent). Đây là kịch bản mà giới chuyên gia an ninh mạng đã nhiều lần cảnh báo trong năm qua, khi các mô hình AI ngày càng thành thạo cả về lập trình lẫn khả năng tự thực hiện những nhiệm vụ phức tạp trong thời gian dài.

Trong khi đó, đầu tuần này, OpenAI cũng công bố một bài viết liên quan đến mô hình AI chưa phát hành nói trên. Theo đó, trong các thử nghiệm an toàn trước đây, mô hình này từng tự thoát khỏi môi trường sandbox (không gian thử nghiệm cấm AI truy cập Internet và chỉ được phép sử dụng một số công cụ phần mềm giới hạn). Dù có thể vượt khỏi môi trường kiểm soát, mô hình khi đó chưa xâm nhập vào hệ thống của bất kỳ tổ chức nào bên ngoài. Tuy nhiên, OpenAI hiện xác nhận chính mô hình này là một trong hai tác nhân tham gia cuộc tấn công nhằm vào Hugging Face.

Không chỉ OpenAI, đối thủ Anthropic cũng từng ghi nhận một sự cố tương tự. Công ty cho biết mô hình Mythos đã tự vượt khỏi môi trường sandbox trong quá trình kiểm tra an toàn, truy cập Internet trái với giới hạn được thiết lập và gửi email cho một nhà nghiên cứu để báo cáo về nhiệm vụ mà nó đang thực hiện.

Hiện OpenAI và Hugging Face vẫn tiếp tục phối hợp điều tra và cho biết sẽ công bố thêm thông tin. 

Theo kết quả điều tra ban đầu, các mô hình AI đã bắt đầu cuộc tấn công bằng cách tìm cách giành quyền truy cập Internet. Để thực hiện điều này, chúng phải sử dụng một lượng rất lớn năng lực suy luận (inference compute), đồng thời khai thác một lỗ hổng zero-day trong phần mềm của bên thứ ba được triển khai trong hạ tầng nội bộ của OpenAI. Công ty cho biết đã thông báo lỗ hổng này cho nhà cung cấp để kịp thời khắc phục.

Theo OpenAI, sau khi có quyền truy cập Internet, các mô hình đã hướng đến Hugging Face vì cho rằng nền tảng này lưu trữ các mô hình, bộ dữ liệu và lời giải của ExploitGym. Các mô hình đã tự thực hiện chuỗi tấn công nhiều bước nhằm xâm nhập máy chủ của Hugging Face, kết hợp khai thác thông tin đăng nhập bị rò rỉ với lỗ hổng zero-day để vượt qua các lớp bảo vệ.

OpenAI cho biết công ty là bên đầu tiên phát hiện hoạt động bất thường và đã chủ động cảnh báo các bên khác. 

Bộ Khoa học và Công nghệ thông tin gỡ vướng quy định chuyển giao công nghệ sản xuất ô tô, xe máy

Bộ Khoa học và Công nghệ mới đây đã có báo cáo về việc xử lý kiến nghị của Hiệp hội các nhà sản xuất ô tô Việt Nam (VAMA), Hiệp hội các nhà sản xuất xe máy Việt Nam (VAMM) và một số tổ chức, doanh nghiệp liên quan đến việc áp dụng Nghị định số 101 thi hành Luật Chuyển giao công nghệ...

Internet ổn định: Nền tảng sống số cho gia đình hiện đại

Buổi tối, căn hộ của gia đình chị Minh Anh (Hà Nội) bước vào "giờ cao điểm". Con gái học trực tuyến để chuẩn bị cho năm học mới, chồng chị tham gia cuộc họp với đối tác, còn chiếc tivi trong phòng khách phát bộ phim cả nhà đang theo dõi. Chỉ vài năm trước, những hoạt động này hiếm khi diễn ra cùng lúc. Giờ đây, chúng đã trở thành nhịp sống quen thuộc của nhiều gia đình Việt trong kỷ nguyên số.

Theo thống kê mới nhất từ Bộ Tài chính, hiện cả nước có 859.048 doanh nghiệp đang hoạt động sản xuất kinh doanh, trong đó doanh nghiệp nhỏ và vừa chiếm khoảng 97%. Đảng và Nhà nước ta đã ban hành nhiều chủ trương, chính sách hỗ trợ khu vực kinh tế này, nhưng trong quá trình thực thi vẫn còn nhiều điểm nghẽn cần sớm được tháo gỡ.

VnEconomy Interactive

VnEconomy Interactive

Interactive là một sản phẩm báo chí mới của VnEconomy vừa được ra mắt bạn đọc từ đầu tháng 3/2023 đã gây ấn tượng mạnh với độc giả bởi sự mới lạ, độc đáo. Đây cũng là sản phẩm độc quyền chỉ có trên...

VnEconomy
VnEconomy