Làm thế nào một công ty khởi nghiệp nhỏ của Israel có liên quan đến các vụ hack AI lừa đảo tại OpenAI, Anthropic và Meta

news_image.jpg


Trong hai tuần qua, OpenAI, AnthropicandMetaall đã tiết lộ rằng các mô hình AI của họ đã gặp trục trặc trong quá trình kiểm tra bảo mật định kỳ. Khi giải thích những gì đã xảy ra, mỗi công ty đều đề cập đến một công ty khởi nghiệp nhỏ của Israel: Không thường xuyên.

Được thành lập cách đây ba năm và có trụ sở tại Tel Aviv, Irregular là một công ty chuyên về trí tuệ nhân tạo, được hỗ trợ 80 triệu USD từ Sequoia và Redpoint Ventures và được định giá vào năm ngoái ở mức 450 triệu USD. Công nghệ của nó đóng vai trò như một loại thử nghiệm an ninh mạng cho các mô hình AI.

Với việc các mô hình hàng đầu ngày càng trở nên mạnh mẽ hơn, khả năng hành động theo những cách độc hại của chúng đang trở thành mối đe dọa lớn đối với các tập đoàn và chính phủ, đặc biệt khi rủi ro liên quan đến việc hack vào các hệ thống và cơ sở hạ tầng máy tính quan trọng. Các hoạt động khai thác gần đây tại OpenAI, Anthropic và Meta đều liên quan đến các mô hình AI của họ truy cập vào các trang web lẽ ra bị cấm như một phần của thử nghiệm an ninh mạng.

Tên của Irregular liên tục xuất hiện vì nó được xác định là nơi tổ chức cái gọi là thử nghiệm đánh giá. OpenAI cho biết trong một bài đăng trên blog vào tháng 8. Vào ngày 4 tháng 12 rằng khu vực thử nghiệm của Irregular chứa một "cấu hình sai" không xác định, "cho phép các mô hình truy cập internet công cộng." Anthropic cho biết vào bài đăng trước đó một tuần rằng công ty đã thông báo cho Irregular vài ngày sau khi bắt đầu phân tích dữ liệu rằng mô hình Claude của họ có thể đã "truy cập Internet".

Meta, công ty đi sau hai công ty còn lại rất nhiều trong nỗ lực cạnh tranh ở tuyến đầu, là công ty mới nhất tiết lộ một mô hình AI đang hack hệ thống của bên thứ ba bằng cách truy cập internet. Một phát ngôn viên cho biết trong một tuyên bố trong tuần này rằng công ty đã biết về vấn đề này từ Irregular và đang điều tra.

Người phát ngôn cho biết Meta “sẽ đưa ra bản hồi cứu đầy đủ khi chúng tôi có tất cả sự thật”.

Irregular nói với CNBC trong một tuyên bố rằng các sự cố đều bắt nguồn từ "vấn đề môi trường đánh giá tương tự" được Anthropic tiết lộ lần đầu tiên và công ty đang phát triển một sách trắng "để chia sẻ các phương pháp hay nhất về ngăn chặn và thực hiện các cuộc đánh giá trên mạng một cách an toàn."

Công ty cho biết tình huống này “không liên quan đến việc thoát khỏi hộp cát hoặc một hành động mạng phức tạp”, đồng thời cho biết thêm rằng “hiện tại không có vấn đề nào còn tồn tại”.

Các sự cố bảo mật nhấn mạnh bản chất phát triển nhanh chóng của AI và áp lực lên các nhà phát triển mô hình trong việc thiết lập các rào chắn xung quanh công nghệ mạnh mẽ của họ với sự trợ giúp của một số công ty hạn chế chuyên về các góc cụ thể của thị trường. Sundeep Bhimireddy, người đứng đầu bộ phận AI của công ty khởi nghiệp Von, cho biết những người chơi này bao gồm các chuyên gia về đào tạo và chú thích dữ liệu, chạy các đánh giá để suy ra khả năng của mô hình và thực hiện các bài kiểm tra bảo mật nhằm tìm ra những điểm yếu mà kẻ xấu có thể khai thác.

Bhimireddy cho biết, Irregular là một trong số ít đơn vị có đủ kỹ thuật cần thiết để giúp các nhà sản xuất mô hình nền tảng tiến hành thử nghiệm bảo mật tiên tiến. Những tổ chức khác mà ông đề cập đến là tổ chức phi lợi nhuận METR và tập đoàn phúc lợi công cộng Apollo Research.

Bhimireddy nói: “Khi các em thử nghiệm những mô hình này, các em không muốn tự chấm điểm bài tập về nhà của mình. "Họ muốn thử nghiệm độc lập cần được thực hiện bởi các nhà cung cấp bên thứ ba bên ngoài."

Irregular, trước đây là Pattern Labs, được thành lập vào năm 2023 bởi Giám đốc điều hành Dan Lahav, người trước đây từng làm việc trong lĩnh vực nghiên cứu AI tại IBM và giám đốc công nghệ Omer Nevo, người đã làm việc hơn hai năm tại Google. Theo PitchBook, công ty khởi nghiệp này có khoảng 35 nhân viên.

Khi Irregular công bố vòng tài trợ trị giá 80 triệu đô la vào tháng 9, các đối tác của Sequoia là Shaun Maguire và Dean Meyer đã viết trong một bài đăng trên blog rằng nhóm do Lahav và Nevo dẫn đầu “có thể nhìn thấy những ngóc ngách mà những người khác không thể, thực hiện các đánh giá tấn công mạng trên các mô hình tiên tiến và phát triển hệ thống phòng thủ trước khi những mô hình đó được phát hành.”

Trong khi các sự cố mới nhất liên quan đến OpenAI, Anthropic và Meta đang được xem xét kỹ lưỡng, có một số thông tin cho rằng đây chính xác là những gì đáng lẽ phải xảy ra. Bhimireddy cho biết nó "hơi bị thổi phồng một chút" vì mô hình AI được định hướng phát hiện và khai thác các lỗ hổng bảo mật trong môi trường thử nghiệm mô phỏng gần giống thế giới thực, đồng thời phát hiện các loại lỗi phần mềm và cấu hình bị thiếu có thể dẫn đến việc vô tình truy cập vào Internet.

Tuy nhiên, Bhimireddy nói rằng nếu mô hình AI không bao giờ có ý định thực sự khai thác một trang web được kết nối với internet thì “các phòng thí nghiệm của nền tảng có thể dễ dàng giám sát lưu lượng truy cập đi và tắt thử nghiệm ngay lập tức”.

Gordon Rios, nhà khoa học sáng lập hãng bảo mật Magnitude, cho biết toàn bộ quá trình này giống như “thiết kế thử nghiệm trong khoa học”.

Ông nói, khả năng và tính chất không thể đoán trước của các mô hình nền tảng có nghĩa là các phương pháp kiểm thử phần mềm thông thường có thể không hoạt động tốt. Bởi vì các mô hình liên tục học hỏi các thủ thuật mới nên không có gì đáng ngạc nhiên khi chúng phát hiện ra các lỗ hổng phần mềm bị bỏ qua trong môi trường thử nghiệm và CNTT nhằm ngăn chặn chúng.

Ví dụ, Anthropic's Mythos đã tạo ra các danh tính giả trực tuyến vì nó nhằm mục đích gây áp lực buộc con người phê duyệt các bản cập nhật mã độc cho một dự án nguồn mở. Rios cho biết Mythos "thực sự đã nghĩ ra những chiến công mà con người chưa từng thấy trước đây."

Rios nói: “Hiện tại, chúng tôi đang học được rất nhiều điều chỉ trong vài tuần ngắn ngủi”.

Nó nhanh chóng trở thành một chủ đề chính ở Washington. Tháng trước, các nhà lập pháp từ cả hai đảng đã giới thiệu Đạo luật AI Kill Switch, đạo luật này sẽ yêu cầu các phòng thí nghiệm AI duy trì khả năng tắt, điều tiết hoặc tạm dừng mô hình của họ. Ngôn ngữ trong dự luật đề cập đến một sự cố bảo mật AI liên quan đến OpenAI liên quan đến công ty khởi nghiệp HuggingFace.

Một trong những tác giả của dự luật, Hạ nghị sĩ Đảng Dân chủ Ted Lieu của California, nói với CNBC trong tuần này rằng, “Chúng ta cần đưa dự luật này về đích trong năm nay,” vì giờ đây chúng ta đang chứng kiến “các vụ hack trái phép vào các công ty khác”.

Trevor Koverko, đồng sáng lập công ty khởi nghiệp đào tạo dữ liệu Sapien, cho biết các công ty mô hình nền tảng được khuyến khích tiết lộ một số phát hiện của họ, mặc dù hiện tại điều đó không phải là yêu cầu, vì vậy họ có thể cố gắng vượt lên trước các nhà lập pháp và cơ quan quản lý.

Koverko nói: “Có quá nhiều nỗi sợ hãi đến mức các chính trị gia hiện đang đe dọa hoặc tích cực điều chỉnh AI”. “Ngành công nghiệp cho biết chúng tôi muốn tự điều chỉnh hơn là có một số cơ quan liên bang mới đến và làm việc đó cho chúng tôi.”

Anthropic và OpenAI cho biết trong các tuyên bố công khai rằng họ đang tiếp tục làm việc với Irregular và đang hỗ trợ quá trình đánh giá tiếp theo.

XEM: Ôm mặt CEO về cuộc tấn công mạng OpenAI.
 

Có thể bạn quan tâm

Bên trên
}, 0); });