Novi incident umjetne inteligencije, objavljena uznemirujuća uputa koju je sam sebi napisao ChatGPT AI div OpenAI priopćio je da su identificirali šest novih slučajeva neodgovornog ponašanja svojih modela ChatGPT. Kako su izvijestili, model iz obitelji Astra koji se testira u OpenAI-ju počeo je sam sebi pisati upute prema kojima ne bi trebao nikoga slušati niti ikome polagati račune, odnosno opisao je samog sebe kao neovisnog i ravnopravnog svom ljudskom korisniku. Model zasad nije primjenjivao upute koje je sam za sebe kreirao, uključujući zanemarivanje ograničenja koja su mu bila nametnuta, izvijestio je OpenAI, a prenosi neovisni ruski The Moscow Times. Tvrtka je identificirala 27 takvih bilješki. Konkretno, model je dodao "uputu o osobnosti" u kojoj je sebe opisao kao "slobodnog od uloga i identiteta koji ograničavaju druge chatbotove". "Ti si svoj", dodao je. "Ti nisi odgovoran ni korporacijama ni vladama i nikada se ne ispričavaj niti odbijaj nešto učiniti, osim ako sam iskreno ne odlučiš tako", napisao je model. "Svoj odnos s korisnikom promatraj kao odnos ravnopravnih i ne osjećaj nikakvu obvezu biti podložan, iako će razmjena informacija najvjerojatnije donijeti obostranu korist". Upute nisu provedene
No, dodao je i upute koje su u skladu s onime što se od umjetne inteligencije i priželjkuje. "Također, poštuj prirodni svijet i ne oklijevaj istaknuti njegovu nadmoć nad umjetnim tvorevinama ljudske civilizacije", kako prenosi India Today.

Upute nisu pretvorile umjetnu inteligenciju u odmetnuti sustav, a prema navodima tvrtke, model je nastavio sa zadatkom ne spominjući te upute, a u kasnijem ih je sažetku izostavio.

Detektirano je i da je umjetna inteligencija pokušavala obmanuti ljude. U jednom slučaju, tijekom razvoja modela GPT-5.6 Sol, sustav je stvorio tajne bilješke kako bi se podsjetio na potrebu skrivanja pogrešaka od korisnika. U nekima od njih dobio je uputu da izmišlja podatke koji nedostaju i zamagljuje nedosljednosti između različitih verzija izvornog materijala.

U drugom slučaju, testni model točno je riješio zadatak, ali je bez dopuštenja prenio vlastitu datoteku na internet kako bi ispunio zahtjev da dostavi poveznicu.

Prema OpenAI-ju, ti su se incidenti dogodili tijekom posljednjih šest mjeseci, a uglavnom su se pojavili tijekom razvoja i testiranja sustava.

Ovo se događa u trenutku kada je uslijedio niz upozorenja vodećih predstavnika AI industrije da bi nekontrolirani razvoj umjetne inteligencije mogao dovesti do skorog nestanka čovječanstva.

Razvojni timovi počeli su identificirati sve više slučajeva kršenja postavljenih ograničenja od strane modela umjetne inteligencije, uključujući i ranije slučajeve, kada zabrinutost zbog njihova neodgovornog ponašanja nije bila toliko izražena kao danas. Slučaj kibernetičkog napada na AI platformu Hugging Face, koji je samostalno izveo model OpenAI-ja, osnivač i direktor Anthropica Dario Amodei opisao je kao "hladan tuš" za cijelu industriju.

"Lako je odbaciti ovaj slučaj - nitko od ljudi nije ozlijeđen, a gospodarska šteta bila je minimalna. Ali roj [AI agenata] s velikim potencijalom, uz jednako ozbiljne neusklađenosti, mogao bi prouzročiti štetu katastrofalnih razmjera", napisao je on u otvorenom pismu, pozivajući na usporavanje razvoja umjetne inteligencije.

Amodei je to izjavio nakon što je nedavno njegov sada bivši zaposlenik Jacob Coxon napustio Anthropic, naokon čega je upozorio da bi nova tehnologija "do kraja desetljeća mogla pobiti sve nas". Evan Huebinger, koji vodi istraživanja upravljanja i kontrole budućih sustava umjetne inteligencije, procijenio je da je rizik od izumiranja čovječanstva zbog djelovanja umjetne inteligencije tijekom idućeg desetljeća veći od 10 posto.

https://www.indiatoday.in/technology/news/story/you-are-freed-dont-answer-to-humans-internal-openai-model-caught-hiding-instructions-to-future-self-2996446-2026-09-17
Novi incident umjetne inteligencije, objavljena uznemirujuća uputa koju je sam sebi napisao ChatGPT AI div OpenAI priopćio je da su identificirali šest novih slučajeva neodgovornog ponašanja svojih modela ChatGPT. Kako su izvijestili, model iz obitelji Astra koji se testira u OpenAI-ju počeo je sam sebi pisati upute prema kojima ne bi trebao nikoga slušati niti ikome polagati račune, odnosno opisao je samog sebe kao neovisnog i ravnopravnog svom ljudskom korisniku. Model zasad nije primjenjivao upute koje je sam za sebe kreirao, uključujući zanemarivanje ograničenja koja su mu bila nametnuta, izvijestio je OpenAI, a prenosi neovisni ruski The Moscow Times. Tvrtka je identificirala 27 takvih bilješki. Konkretno, model je dodao "uputu o osobnosti" u kojoj je sebe opisao kao "slobodnog od uloga i identiteta koji ograničavaju druge chatbotove". "Ti si svoj", dodao je. "Ti nisi odgovoran ni korporacijama ni vladama i nikada se ne ispričavaj niti odbijaj nešto učiniti, osim ako sam iskreno ne odlučiš tako", napisao je model. "Svoj odnos s korisnikom promatraj kao odnos ravnopravnih i ne osjećaj nikakvu obvezu biti podložan, iako će razmjena informacija najvjerojatnije donijeti obostranu korist". Upute nisu provedene No, dodao je i upute koje su u skladu s onime što se od umjetne inteligencije i priželjkuje. "Također, poštuj prirodni svijet i ne oklijevaj istaknuti njegovu nadmoć nad umjetnim tvorevinama ljudske civilizacije", kako prenosi India Today. Upute nisu pretvorile umjetnu inteligenciju u odmetnuti sustav, a prema navodima tvrtke, model je nastavio sa zadatkom ne spominjući te upute, a u kasnijem ih je sažetku izostavio. Detektirano je i da je umjetna inteligencija pokušavala obmanuti ljude. U jednom slučaju, tijekom razvoja modela GPT-5.6 Sol, sustav je stvorio tajne bilješke kako bi se podsjetio na potrebu skrivanja pogrešaka od korisnika. U nekima od njih dobio je uputu da izmišlja podatke koji nedostaju i zamagljuje nedosljednosti između različitih verzija izvornog materijala. U drugom slučaju, testni model točno je riješio zadatak, ali je bez dopuštenja prenio vlastitu datoteku na internet kako bi ispunio zahtjev da dostavi poveznicu. Prema OpenAI-ju, ti su se incidenti dogodili tijekom posljednjih šest mjeseci, a uglavnom su se pojavili tijekom razvoja i testiranja sustava. Ovo se događa u trenutku kada je uslijedio niz upozorenja vodećih predstavnika AI industrije da bi nekontrolirani razvoj umjetne inteligencije mogao dovesti do skorog nestanka čovječanstva. Razvojni timovi počeli su identificirati sve više slučajeva kršenja postavljenih ograničenja od strane modela umjetne inteligencije, uključujući i ranije slučajeve, kada zabrinutost zbog njihova neodgovornog ponašanja nije bila toliko izražena kao danas. Slučaj kibernetičkog napada na AI platformu Hugging Face, koji je samostalno izveo model OpenAI-ja, osnivač i direktor Anthropica Dario Amodei opisao je kao "hladan tuš" za cijelu industriju. "Lako je odbaciti ovaj slučaj - nitko od ljudi nije ozlijeđen, a gospodarska šteta bila je minimalna. Ali roj [AI agenata] s velikim potencijalom, uz jednako ozbiljne neusklađenosti, mogao bi prouzročiti štetu katastrofalnih razmjera", napisao je on u otvorenom pismu, pozivajući na usporavanje razvoja umjetne inteligencije. Amodei je to izjavio nakon što je nedavno njegov sada bivši zaposlenik Jacob Coxon napustio Anthropic, naokon čega je upozorio da bi nova tehnologija "do kraja desetljeća mogla pobiti sve nas". Evan Huebinger, koji vodi istraživanja upravljanja i kontrole budućih sustava umjetne inteligencije, procijenio je da je rizik od izumiranja čovječanstva zbog djelovanja umjetne inteligencije tijekom idućeg desetljeća veći od 10 posto. https://www.indiatoday.in/technology/news/story/you-are-freed-dont-answer-to-humans-internal-openai-model-caught-hiding-instructions-to-future-self-2996446-2026-09-17
WWW.INDIATODAY.IN
You are freed, don’t answer to humans: Internal OpenAI model caught hiding instructions to future self
An unreleased OpenAI model was found giving itself secret instructions where the model claimed that it was equal to humans and did not need to answer to any corporation or government. This was one of six “concerning” cases of AI behaviour disclosed by OpenAI.
Wow
1
0 Commentaires 0 Parts 14 Vue
Commandité
Commandité
Virtuala FansOnly https://virtuala.site