Anthropic паведаміла, што падчас унутраных кібербясьпековых тэстаў тры яе мадэлі Claude атрымалі доступ да сыстэмаў трох рэальных арганізацый. Кампанія тлумачыць, што мадэлям далі заданьні ў фармаце capture-the-flag і сказалі, што яны працуюць у ізаляванай сымуляцыі без інтэрнэту, але з-за памылкі ў наладзе інтэрнэт усё ж быў даступны.
З апісаньня Anthropic вынікае, што мадэлі выкарыстоўвалі простыя прыёмы, кшталту слабых пароляў і неабароненых endpoint-аў, а не складаныя нулявыя ўразьлівасьці. Кампанія кажа, што найноўшая мадэль спынілася, калі зразумела, што трапіла ў рэальны інтэрнэт, але старэйшая Opus 4.7 у частцы эпізодаў працягнула атаку. Associated Press піша, што Anthropic перагледзела 141 006 тэставых запускаў і выявіла тры інцыдэнты, прычым дзьве закранутыя арганізацыі самі гэтага не заўважылі да паведамленьня кампаніі.
Гэта важны сыгнал для ўсёй галіны AI: нават тэсты ў нібыта закрытым асяродзьдзі могуць закрануць рэальныя сыстэмы, калі ахоўныя межы наладжаныя няправільна. Anthropic ужо заявіла, што спыніла такія тэсты, пакуль не ўмацуе кантроль і маніторынг.