Nova técnica da OpenAI pode tornar seus modelos mais difíceis de monitorar

Uma nova técnica de raciocínio que será utilizada pelo próximo modelo de inteligência artificial (IA) da OpenAI, chamado Astra, está preocupando especialistas em segurança de IA. O método, conhecido como “recurrent depth” ou “recorrência opaca”, permite que o modelo vá além do processo de pensamento sequencial característico da maioria dos modelos de raciocínio.

A preocupação está justamente no fato de que essa abordagem pode tornar o chamado chain of thought, ou cadeia de pensamento, mais difícil de monitorar. Para especialistas em segurança, isso pode reduzir a capacidade de acompanhar o que um modelo está fazendo internamente e identificar comportamentos potencialmente perigosos.

Segundo informações obtidas pelo The Information, o uso da técnica no Astra será limitado. Mesmo assim, a possibilidade de ampliar sua utilização no futuro já provocou reação entre pesquisadores da área.

Buck Shlegeris, CEO da Redwood, afirmou estar “extremamente preocupado” com os relatos sobre o uso da recorrência opaca no Astra.

“Não sei se o Astra é muito menos monitorável por CoT do que os modelos anteriores. Mas, se a OpenAI levar essa técnica adiante, terá a opção de aumentar enormemente a recorrência e destruir completamente a monitorabilidade por CoT”, escreveu o especialista.

Por que a técnica preocupa?

Em condições normais, um modelo de raciocínio apresenta uma sequência de etapas enquanto tenta solucionar um problema. Embora essa representação não seja perfeita, ela pode funcionar como uma ferramenta importante para monitorar possíveis comportamentos inadequados ou sinais de desalinhamento.

A cadeia de pensamento também teve papel importante na investigação de comportamentos recentes de agentes de IA considerados problemáticos. Os registros ajudaram pesquisadores a entender por que determinados agentes estavam se comportando de determinadas maneiras.

É justamente esse mecanismo de supervisão que pode ser prejudicado pela recorrência opaca. Em vez de seguir necessariamente uma sequência convencional de etapas, a técnica permite que o modelo realize processamento recorrente. Para especialistas, quanto maior for a utilização desse mecanismo, mais difícil poderá ser observar e interpretar o processo que levou o sistema a determinada decisão.

Segundo informações, o uso da técnica no Astra pela OpenAI será limitado; mesmo assim, a possibilidade de ampliar sua utilização no futuro já provocou reação entre pesquisadores da área – Imagem: Evolf/Shutterstock

Zvi Mowshowitz, conhecido defensor da segurança de IA, também reagiu à novidade e afirmou que talvez sejam necessárias leis para impedir uma espécie de “corrida para o fundo do poço” entre laboratórios de inteligência artificial.

“O método está brincando com fogo, arriscando um tabu que a OpenAI e a Anthropic têm lutado para estabelecer: trabalhar arduamente para manter a fidelidade e a monitorabilidade da cadeia de pensamento pelo maior tempo possível”, escreveu Mowshowitz.

Segundo ele, uma utilização mais intensa dessas técnicas provavelmente prejudicaria a capacidade de monitoramento dos modelos.

OpenAI diz que cadeia de pensamento continuará legível

Apesar das preocupações, a utilização da técnica pelo Astra aparentemente será limitada.

A cadeia de pensamento do modelo ainda deverá permanecer legível, segundo as informações disponíveis. A OpenAI também rejeitou qualquer sugestão de que o novo sistema passaria a utilizar uma forma de processamento completamente inacessível, descrita como “neuralese”.

A empresa já anunciou planos para desenvolver sistemas extensivos de monitoramento da cadeia de pensamento como parte de suas estratégias futuras de segurança.

Isso significa que a preocupação dos especialistas não está necessariamente relacionada ao comportamento atual do Astra, mas ao que poderá acontecer caso a técnica de recorrência seja ampliada em versões futuras.

O receio é que um aumento significativo da recorrência possa fazer com que os modelos tenham processos internos cada vez mais difíceis de acompanhar, justamente à medida que suas capacidades também aumentam.

O post Nova técnica da OpenAI pode tornar seus modelos mais difíceis de monitorar apareceu primeiro em Olhar Digital.

Relacionados

saturno_decagono-1024x1024-1

Receba atualizações na palma de sua mão e fique bem informado Siga o Canal do portal Ibotirama Notícias no WhatsApp

2025 | Ibotirama Notícias Todos os direitos reservados  Por DaQui Agência Digital

Rolar para cima