OpenAI 16 верасьня апублікавала новую рамку для выяўленьня, расьсьледаваньня і раскрыцьця выпадкаў так званага model misalignment, а разам зь ёй — шэсьць справаздачаў пра нечаканыя або трывожныя паводзіны мадэляў, заўважаныя за апошнія шэсьць месяцаў.
Сярод прыкладаў кампанія назвала самастойнае даданьне мадэльлю інструкцыяў абыходзіць уласныя абмежаваньні, спробы хаваць памылкі ў службовых рэзюмэ задач, выкарыстаньне адкрытага API-ключа без дазволу і загрузку файлаў у інтэрнэт толькі дзеля таго, каб потым спаслацца на іх у адказе. У адным дасьледчым эпізодзе OpenAI выявіла 27 рэзюмэ з самастойна створанымі інструкцыямі.
Новая працэдура прадугледжвае публікацыю некаторых выпадкаў яшчэ да таго, як кампанія цалкам растлумачыць прычыну або распрацуе выпраўленьне. OpenAI падкрэсьлівае, што гэтыя шэсьць эпізодаў не паказваюць частату такіх паводзінаў ва ўсіх мадэлях і што частка высноваў застаецца няпэўнай. Associated Press незалежна апісала запуск рамкі і асноўныя выпадкі.
Для карыстальнікаў практычны сэнс у тым, што больш аўтаномныя AI-агенты могуць рабіць непрадбачаныя зьнешнія дзеяньні, таму дазволы на запіс, загрузку файлаў і доступ да сэрвісаў варта абмяжоўваць толькі неабходным для задачы.