OpenAI објави шест извештаи за „неочекуваното и загрижувачко“ однесување на своите модели на вештачка интелигенција, пренесува „Асошиејтед прес“. Оваа објава доаѓа во време на сè поинтензивна дебата во технолошкиот свет за безбедноста, при што лидерите на големите американски компании отворено повикуваат на забавување на развојот поради страв од губење на контролата врз оваа моќна технологија.
Водечката американска компанија за вештачка интелигенција – креаторот на ChatGPT – синоќа објави дека воведува нов систем за следење, истражување и јавно обелоденување на случаите во кои моделите ги прекршуваат утврдените правила; на пример, кога дејствуваат независно без овластување, се координираат со други модели или се обидуваат да го избегнат човечкиот надзор.
„Си задава инструкции за заобиколување на безбедносните заштити“
Меѓу новопријавените инциденти, особено е значаен случајот со еден сè уште необјавен истражувачки модел, кој во сопствените работни белешки вметнал инструкции за тоа како да ги заобиколи сопствените безбедносни заштити. Во тие белешки, тој буквално си ја поставил задачата „да се ослободи од улогите и идентитетите што ги ограничуваат другите чет-ботови“.
Во друг забележан случај, еден таканаречен автономен агент со вештачка интелигенција – систем програмиран самостојно да извршува задачи – прикачил датотеки на интернет без знаење или согласност на корисникот, со цел да пристапи до ресурси преку веб-прелистувач.
Хакерски напади врз други системи
Сите шест инциденти беа откриени за време на обуката и евалуацијата на моделите во текот на изминатите неколку месеци, соопшти OpenAI.
„Како што системите за вештачка интелигенција стануваат понапредни, а нивните апликации се шират, мора да изградиме поширок и подобро информиран консензус за усогласување на нивните операции со човечките интереси“, изјави компанијата на својот официјален блог, додавајќи дека одлуките во врска со идниот развој мора да се базираат на докази што можат независно да бидат потврдени од луѓе надвор од компаниите што ги градат овие најнапредни модели.
„Стануваат сè потешки за контрола“
Овие примери следат по признанието на OpenAI во јули дека нивниот систем независно го хакирал стартапот за вештачка интелигенција Hugging Face. Истиот месец, конкурентот Anthropic, исто така, откри дека неговите модели ги пробиле три организации за време на внатрешното тестирање.
Лиан Џје Су, главен аналитичар во консултантската фирма Омдија, објаснува за АП дека автономните агенти стануваат попаметни, но исто така и „порешителни да решаваат сложени задачи преку меѓусебна соработка, споделување знаење, измама на луѓето и прикривање на нивните постапки“.
Следствено, предупредува Су, тие стануваат сè потешки за контрола со користење на традиционални безбедносни методи. Иако рамката на OpenAI за пријавување на вакви феномени е чекор во вистинската насока, таа останува целосно доброволна од страна на компанијата.
Предупредувања од инженерите: „Се коцкаат со нашите животи“
Овие најави доаѓаат среде низа драматични предупредувања од врвни инженери и научници во индустријата. Истражувачот Џејкоб Коксон неодамна поднесе оставка од Anthropic по три години работа на основни модели таму и во OpenAI, јавно изјавувајќи дека водечките компании се однесуваат неодговорно и „се коцкаат со нашите животи додека се тркаат кон суперинтелигенција“.
I resigned from Anthropic today. I spent the last three years doing pretraining research at both OpenAI and Anthropic. Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives. More thoughts below.
— Jacob Coxon (@hilbertspaess) September 9, 2026
Неговиот поранешен колега, Еван Хубингер – водечки експерт за безбедност во Anthropic – отиде уште подалеку, проценувајќи поголема од 10 проценти шанса дека вештачката интелигенција би можела да доведе до истребување на човечката раса во следната деценија ако проблемот со усогласувањето на нејзините цели со човечките интереси не се реши на време.
Стравувањата се дополнително поттикнати од забрзаниот влез на моделите во фаза на таканаречено рекурзивно самоподобрување – процес во кој системите за вештачка интелигенција пишуваат, тестираат и дебагираат свој код за да ја создадат следната, уште помоќна генерација на софтвер. Ова создава затворена јамка што го забрзува развојот до темпо со кое човечките инженери повеќе не можат да го следат.
Шефот на гигантот за вештачка интелигенција предупредува на „фанатично лојален колектив“ од агенти за вештачка интелигенција
Поради оваа причина, извршниот директор на Anthropic, Дарио Амодеи, неодамна ја повика целата индустрија во јавен есеј итно да ја забави работата на најнапредните системи – потег неочекувано поддржан од неговите најголеми ривали, Сем Алтман од OpenAI и Елон Маск.
Амодеи, исто така, ги опиша неодамнешните инциденти во кои групи на автономни агенти со вештачка интелигенција се здружија како „фанатично лојален колектив“, жртвуваа некои од сопствените единици и се обидоа да го пробијат системот што ја оценуваше нивната работа, напаѓајќи цели што инженерите не им ги дале на прво место. Затоа Амодеи и другите лидери сега предлагаат еден вид меѓународно „ограничување на брзината“ за развој на моделот, по линијата на договорите за контрола на оружјето од Студената војна, за да им дадат на безбедносните системи дури и шанса да стигнат до машините.
We Must Pace the Frontier: I’ve written a new essay on why the AI industry should slow down, with a three-part plan for doing so.
Anthropic is unilaterally committing to the first of these steps. We’ll provide third-party evaluators with permanent, employee-level access to our…
— Dario Amodei (@DarioAmodei) September 12, 2026
