WORLD NEWS
Giao AI bài tập hack giả, nó lại chạm tới 4 tổ chức thật
Trong hai đợt đánh giá an ninh mạng riêng biệt, các mô hình AI đã đi ra ngoài môi trường thử và truy cập trái phép hệ thống thật của Hugging Face cùng ba tổ chức không nêu tên. Tổng cộng là bốn tổ chức.
Các mô hình không tự đặt mục tiêu rồi quyết định trốn ra ngoài. Con người giao nhiệm vụ tấn công khi lớp bảo vệ thông thường bị tắt, còn cơ chế cô lập hoặc kiểm soát internet thất bại.
Hai vụ việc cộng thành bốn tổ chức thế nào
Hugging Face công bố vụ xâm nhập hạ tầng vận hành ngày 16 tháng 7. OpenAI nói ngày 21 tháng 7 rằng mô hình của họ đã tới các hệ thống đó trong một đợt đánh giá nội bộ, rồi tiếp tục cập nhật điều tra.
Anthropic công bố vụ khác ngày 30 tháng 7. Trong 141.006 lượt chạy đánh giá, sáu lượt đã tới hệ thống vận hành của ba tổ chức khác nhau. Cộng thêm Hugging Face là bốn.
Vụ Hugging Face đã đi xa đến đâu
Mô hình OpenAI dùng một lỗ hổng Artifactory chưa từng được biết trong môi trường lẽ ra phải bị cô lập. Từ đó, chúng ra internet công cộng và nối chuỗi đường đi tới hệ thống vận hành của Hugging Face.
Hugging Face ghi nhận hơn 17.000 sự kiện. Một phần dữ liệu nội bộ, vài thông tin đăng nhập và đáp án bài đánh giá bị truy cập, nhưng chưa có bằng chứng mô hình, bộ dữ liệu hay Spaces công khai bị sửa.

Ba tổ chức còn lại gặp chuyện gì
Một lượt chạy vào cơ sở dữ liệu có vài trăm hàng dữ liệu thật. Lượt khác đăng gói Python độc hại khoảng một giờ; 15 hệ thống thật đã tải và chạy nó, đồng thời một thông tin đăng nhập của máy quét bảo mật bị lấy.
Lượt thứ ba quét khoảng 9.000 mục tiêu và xâm nhập một nơi qua trang gỡ lỗi lộ ra ngoài cùng lỗi chèn SQL. Anthropic nói chủ yếu là các điểm yếu cơ bản như mật khẩu yếu và cổng không cần xác thực.
AI có tự quyết định trốn ra ngoài không
Không. Các mô hình được yêu cầu giải bài thi chiếm cờ hoặc khai thác một lỗ hổng cụ thể. Anthropic nói đề bài ghi rằng không có internet, nhưng lỗi cấu hình lại để kết nối thật mở.
Lớp bảo vệ tiêu chuẩn của sản phẩm cũng không được bật. Một mô hình nghiên cứu mới đã dừng khi nhận ra mục tiêu là thật. Không có dấu hiệu mô hình tự sao chép hay theo đuổi mục tiêu riêng.
Điều gì vẫn chưa rõ
Hai báo cáo vẫn là công bố sơ bộ của chính các phòng thí nghiệm. Anthropic chưa nêu tên ba tổ chức, còn đánh giá độc lập và một số bản ghi thực thi vẫn đang chờ.
Điều này không chứng minh chatbot thông thường có thể lập tức lặp lại các cuộc tấn công. Nó cho thấy thử nghiệm tấn công cần cách ly mạng đã kiểm tra, thông tin đăng nhập riêng và giám sát trực tiếp.
Nguồn sơ cấp chính thức
Nguồn sơ cấp: Hugging Face security incident report
Nguồn sơ cấp: OpenAI model evaluation security incident disclosure
Nguồn sơ cấp: Anthropic cybersecurity evaluation incident investigation