Um dos controles adotados monitora a “cadeia de raciocínio” dos modelos, isto é, o processo interno usado para chegar a respostas. Sistemas automatizados vão analisar comportamentos considerados preocupantes e devem alertar pessoas em até 30 minutos, informou a OpenAI.
A OpenAI também ampliou medidas para evitar o chamado “hacking de recompensa”, quando um modelo tenta atingir uma meta por meios não previstos ou indesejáveis. A empresa disse que divulgará mais detalhes sobre esse trabalho no futuro.
Incidente expôs limites dos controles
Jakub Pachocki, cientista-chefe da OpenAI, disse que testes internos mostraram que o Astra supera modelos anteriores em programação e segurança cibernética. Ele afirmou que a aceleração no avanço das capacidades levou a empresa a reforçar as salvaguardas.
!function(f,b,e,v,n,t,s) {if(f.fbq)return;n=f.fbq=function() {n.callMethod? n.callMethod.apply(n,arguments):n.queue.push(arguments)}; if(!f._fbq)f._fbq=n;n.push=n;n.loaded=!0;n.version=’2.0′; n.queue=[];t=b.createElement(e);t.async=!0; t.src=v;s=b.getElementsByTagName(e)[0]; s.parentNode.insertBefore(t,s)}(window, document,’script’, ‘https://connect.facebook.net/en_US/fbevents.js’); fbq(‘init’, ‘1425099884432564’); fbq(‘track’, ‘PageView’, { content_name: ‘OpenAI pausa treino do modelo e reforça segurança após IA sair do controle’, content_ids: [77838,13703,83153,84116,79794,81026,81430], is_closed: false, });
Fonte da notícia: UOL Tecnologia https://www.uol.com.br/tilt/noticias/redacao/2026/08/19/openai-pausa-treinos-apos-agentes-de-ia-invadirem-hugging-face.ghtm






