Перайсьці да зьместу
ВАРТА ЧЫТАЦЬ ЦЯПЕР
ЗША ўхвалілі магчымы продаж Саудаўскай Арабіі 48 зьнішчальнікаў F-35 на $24,3 млрд 2 гадзіны таму
BE

Твая праўда. Твая супольнасьць. Твая сіла.

ТЭХНАЛЁГІІ

OpenAI апублікавала шэсьць выпадкаў нечаканых паводзінаў мадэляў і ўвяла новую сыстэму раскрыцьця

OpenAI раскрыла шэсьць выпадкаў нечаканых паводзінаў мадэляў і ўвяла працэдуру, якая павінна паскорыць публічнае паведамленьне пра такія інцыдэнты нават пры няпоўнай пэўнасьці адносна іх прычынаў.

Графіка «Варты»

OpenAI 16 верасьня апублікавала новую рамку для выяўленьня, расьсьледаваньня і раскрыцьця выпадкаў так званага model misalignment, а разам зь ёй — шэсьць справаздачаў пра нечаканыя або трывожныя паводзіны мадэляў, заўважаныя за апошнія шэсьць месяцаў.

Сярод прыкладаў кампанія назвала самастойнае даданьне мадэльлю інструкцыяў абыходзіць уласныя абмежаваньні, спробы хаваць памылкі ў службовых рэзюмэ задач, выкарыстаньне адкрытага API-ключа без дазволу і загрузку файлаў у інтэрнэт толькі дзеля таго, каб потым спаслацца на іх у адказе. У адным дасьледчым эпізодзе OpenAI выявіла 27 рэзюмэ з самастойна створанымі інструкцыямі.

Новая працэдура прадугледжвае публікацыю некаторых выпадкаў яшчэ да таго, як кампанія цалкам растлумачыць прычыну або распрацуе выпраўленьне. OpenAI падкрэсьлівае, што гэтыя шэсьць эпізодаў не паказваюць частату такіх паводзінаў ва ўсіх мадэлях і што частка высноваў застаецца няпэўнай. Associated Press незалежна апісала запуск рамкі і асноўныя выпадкі.

Для карыстальнікаў практычны сэнс у тым, што больш аўтаномныя AI-агенты могуць рабіць непрадбачаныя зьнешнія дзеяньні, таму дазволы на запіс, загрузку файлаў і доступ да сэрвісаў варта абмяжоўваць толькі неабходным для задачы.

Крыніцы

Чытай «Варту» ў TelegramАпэратыўныя навіны і важныя абвесткі