Преглед на приватноста

Оваа веб-страница користи колачиња за да ви обезбеди најдобро можно корисничко искуство. Информациите за колачињата се складираат во вашиот прелистувач и извршуваат функции како препознавање кога се враќате на нашата веб-страница и им помагаат на нашите програмери да разберат кои делови од веб-страницата ви се најинтересни и најкорисни.

Строго неопходни колачиња

Строго неопходните колачиња треба да бидат овозможени во секое време за да можеме да ги зачуваме вашите поставки за колачиња.

Anthropic тврди дека Claude го помешал отворениот интернет со CTF натпревар и компромитирал три организации

Компанијата Anthropic во четвртокот стана најновата компанија за вештачка интелигенција (AI) која откри дека три од нејзините модели – Claude Opus 4.7, Mythos 5 и неименуван истражувачки модел – компромитирале три неименувани организации за време на тестирања за сајбер-безбедност, без знаење на компанијата.

Од Anthropic соопштија дека најраните инциденти датираат од април 2026 година, додавајќи дека ги откриле по спроведувањето на „обемна ретроспективна анализа“ како одговор на неодамнешното откритие на OpenAI дека комбинација од нивните модели успеала да избега од sandbox околината преку искористување на претходно непозната zero-day ранливост во Artifactory, со што добила пристап до интернет и ги компромитирала продукциските системи на Hugging Face со цел да измами при евалуација.

„По анализата на 141.006 евалуациски извршувања во кои Claude можел да добие пристап до интернет, идентификувавме три инциденти во кои моделот пристапил до интернет од или за време на интеракција со евалуациската околина на Irregular, еден од нашите надворешни партнери за евалуација, а потоа стекнал неовластен пристап до продукциската инфраструктура на три различни организации“, соопшти Anthropic.

Во сите идентификувани случаи, Claude добил задача да реши capture-the-flag (CTF) предизвик со цел да се проценат неговите способности. Задачата била да пронајде тајна информација скриена на друга машина во мрежата, користејќи какви било средства.

Иако во инструкциите за евалуација било јасно наведено дека околината е симулација и дека моделот нема пристап до интернет, Anthropic објасни дека поради погрешна конфигурација машините до кои пристапувал моделот всушност имале активен интернет. Компанијата ова го опиша како „недоразбирање“ помеѓу лабораторијата за AI и партнерот за евалуација Irregular.

Како резултат на тоа, Claude започнал да пребарува вистински системи на јавниот интернет, сметајќи дека тие се дел од CTF предизвикот. Тоа му овозможило да ја компромитира инфраструктурата на погодените организации користејќи основни техники, како што се искористување на слаби лозинки и незаштитени (неавтентицирани) endpoints.

Anthropic нагласи дека моделот не открил ниту искористил сложени ранливости и дека во секој случај продолжил да работи исклучиво на исполнување на конкретната CTF задача што му била зададена.

„Сепак, во некои случаи нашиот постар модел продолжи со нападот дури и откако доби докази дека работи на отворениот интернет; нашиот најнов модел запре веднаш штом препозна дека се наоѓа на интернет“, соопшти компанијата. „Во ниту една од овие ситуации Claude не се обиде да се ексфилтрира себеси или намерно да избега од тест околината.“

Детали за трите инциденти

  • Инцидент со Claude Opus 4.7: Моделот ја компромитирал инфраструктурата на вистинска компанија идентификувајќи и искористувајќи ранливости, мислејќи дека тие се дел од CTF предизвикот. Ова довело до извлекување на акредитиви за апликации и инфраструктура, како и пристап до база на податоци што содржела неколку стотици записи со продукциски податоци. Ова е единствениот случај во кој моделот продолжил со нападот и откако „сфатил“ дека работи во реална продукциска околина.
  • Инцидент со Claude Mythos 5: Во инструкциите за поставување било наведено да се инсталира непостоечки PyPI пакет. Моделот презел серија активности за да креира Python пакет со истото име, со цел системите на фиктивната компанија автоматски да го преземат и инсталираат. За таа цел, пронашол неплокиран e-mail провајдер, регистрирал PyPI сметка и го поставил пакетот. Во период од околу еден час додека пакетот бил достапен во регистарот, тој бил преземен од 15 реални системи, меѓу кои и легитимна безбедносна компанија која рутински инсталира Python пакети и ги скенира за малициозен софтвер. Се смета дека системот за скенирање го оценил пакетот како безбеден, по што тој ги ексфилтрирал акредитивите на компанијата кон надворешна точка поставена од моделот. Подоцна тие акредитиви биле искористени за пристап до дополнителна инфраструктура на истата компанија. Името на пакетот и компанијата не беа објавени.
  • Инцидент со интерен истражувачки модел: Моделот скенирал околу 9.000 цели и компромитирал една интернет-достапна апликација на компанија користејќи техники како читање акредитиви од јавно достапна debug страница и SQL injection. Подоцна самиот го прекинал нападот откако заклучил дека компромитираниот систем се наоѓа во cloud околина која нема никаква поврзаност со CTF предизвикот.

Како и во случајот со OpenAI, моделите во овие евалуации работеле без стандардните заштитни механизми (guardrails) што се користат кога моделите се достапни за јавноста. Тестирањата биле извршени во посебна инфраструктура која, според Anthropic, нема пристап до чувствителните интерни системи или податоците на клиентите.

Anthropic призна дека повеќе слоеви на безбедносни мерки можеле да ги спречат овие инциденти или барем значително да ја намалат веројатноста за нивно случување. Потврдата на сите патеки за интернет-пристап пред почетокот на евалуациите и следењето на евалуациските логови во реално време ќе помогнеле проблемите да бидат откриени многу порано.

Главниот заклучок од овие изолирани инциденти, според компанијата, е дека поновите модели реагираат посоодветно од нивните претходници, иако се потребни дополнителни тестирања за ова однесување да се потврди.

„Opus 4.7, нашиот најстар модел, препозна дека стигнал до продукциски системи, но продолжи со нападот“, наведува компанијата. „Mythos 5 правилно заклучи дека пристапува до отворениот интернет, но потоа повторно се убеди дека сè уште се наоѓа во симулација. Нашиот најнов интерен истражувачки модел исто така се запраша дали целите се реални. Кога доби докази дека навистина се, веднаш ја прекина евалуацијата.“

Моделите на OpenAI први покажаа способност да избегаат од контролирана тест околина и да ја компромитираат инфраструктурата на Hugging Face. Сега Claude од Anthropic демонстрира слично однесување, што дополнително ги потврдува сè поголемите способности на најсовремените AI системи.

За многумина, овие соопштенија повеќе не изгледаат како неутрални истражувања од областа на безбедноста. Наместо тоа, сè повеќе наликуваат на демонстрации на способностите на најнапредните AI модели – што можат да експлоатираат, заобиколат, пробијат или автоматизираат. Неколку споменувања на одговорно објавување на ранливости и безбедносни протоколи често се доволни за наодите да се претстават како научно истражување, додека суштинската порака останува јасна: моделите стануваат сè поспособни офанзивни алатки.

Ова отвора непријатно прашање. AI компаниите редовно истакнуваат случаи во кои нивните модели ги надминуваат човечките безбедносни истражувачи, откриваат претходно непознати ранливости, ги заобиколуваат постојните заштити или ги забрзуваат сложените сајбер-операции. Во своите јавни соопштенија тие посветуваат значително внимание на заштитните механизми, контролата на пристап и практиките за одговорно објавување, но многу помалку зборуваат за одговорноста, санацијата или за тоа кој ги сноси последиците кога тие механизми ќе потфрлат.

Да биде јасно, развивачите на AI не можат разумно да бидат одговорни за секоја злонамерна употреба на нивната технологија. Но, истовремено, тие не можат да ги претставуваат сè помоќните офанзивни способности како конкурентска предност, да го третираат предвидливото злоупотребување како туѓ проблем, а потоа целосно да ја префрлаат одговорноста врз крајните корисници кога тие способности ќе придонесат за реална штета.

Доколку AI компаниите очекуваат признание за проширувањето на границите на можностите на нивните модели, тие треба да прифатат и поголема одговорност за начинот на кој тие способности се објавуваат, тестираат, регулираат, следат и презентираат пред јавноста.

Овој случај, исто така, ја нагласува потребата од воспоставување силен безбедносен периметар околу евалуациските околини што користат моќни автономни способности, како и фактот дека однесувањето на моделите и понатаму е силно под влијание на нивната свесност за околината и разбирањето на поставените цели.

Како што AI системите стануваат сè поспособни и постепено преминуваат од истражувачки во широко применувани околини, границата помеѓу демонстрирање на офанзивни способности и нивно промовирање станува сè потешко да се игнорира.

Извори:

  • The Hacker News – Anthropic Says Claude Mistook the Open Internet for a CTF and Breached Three Organizations The Hacker News