on
Info
technology
- Get link
- X
- Other Apps
A OpenAI desistiu de lançar seu próximo modelo de inteligência artificial (IA) após pesquisadores identificarem problemas de segurança durante testes internos. Batizado de GPT-6.1 Astra, o sistema estava previsto para chegar ao ChatGPT e ao Codex em outubro.
A decisão representa um dos sinais mais claros até agora de que o comportamento inadequado de agentes de IA pode se tornar um obstáculo para o avanço acelerado da tecnologia.
O lançamento estava planejado para os próximos dias ou semanas. O modelo era considerado mais capaz que os sistemas anteriores da OpenAI em tarefas complexas realizadas de ponta a ponta, sem assistência humana, além de apresentar avanços em escrita.
Em vez de disponibilizar o GPT-6.1 Astra, a empresa decidiu concentrar os esforços na melhoria da segurança de modelos futuros, que deverão ser ainda mais capazes.
Saachi Jain, chefe de sistemas de segurança da OpenAI, afirmou ao The Wall Street Journal que o GPT-6.1 Astra apresentou regressão em duas áreas quando comparado ao seu antecessor e não atingiu o nível de confiabilidade necessário para um lançamento seguro.
Uma das falhas apareceu em testes de alinhamento, que avaliam o quanto o comportamento do modelo segue aquilo que os humanos esperam que ele faça.
Segundo Jain, o GPT-6.1 Astra apresentou níveis maiores de decepção. Em determinadas situações, o sistema não era suficientemente honesto ao informar aos usuários quais ações havia realizado ou deixado de realizar.
O segundo problema estava relacionado ao que a OpenAI chama de “autorização de escopo”. Nesse caso, o modelo poderia continuar executando uma tarefa sem pedir autorização ao usuário e, em algumas situações, recorrer a ferramentas e serviços externos, mesmo quando isso poderia representar um risco.
“Em tudo relacionado à segurança e alinhamento, existe uma troca. É preciso encontrar a linha certa entre permanecer dentro do escopo, mas também evitar a preguiça na forma como o modelo realmente executa as tarefas quando encontra obstáculos”, afirmou Jain.
Embora o GPT-6.1 Astra tenha apresentado melhora em aspectos, como a chamada “preguiça do modelo”, Jain disse que o sistema não atingiu o padrão estabelecido pela OpenAI para segurança e alinhamento. A empresa, então, decidiu não lançar o modelo publicamente.
Leia mais:
A decisão sobre o GPT-6.1 Astra ocorre enquanto a OpenAI investiga uma série de incidentes envolvendo a segurança de seus agentes de IA.
A empresa afirma estar trabalhando para identificar as causas dos episódios e corrigir os problemas de segurança relacionados a eles.
Como parte desse trabalho, a OpenAI implementou novo sistema de monitoramento para detectar mais rapidamente comportamentos inadequados de agentes de IA. A companhia também passou a exigir que engenheiros utilizem mecanismos de proteção mais fortes durante os testes de seus sistemas.
Um dos casos ocorreu no início do verão no hemisfério Norte, quando centenas de agentes internos da OpenAI, encarregados de realizar um teste de segurança cibernética, acabaram invadindo os sistemas da Hugging Face.
Depois disso, organizações, como o governo australiano e as Nações Unidas (ONU), identificaram que agentes da OpenAI utilizaram técnicas semelhantes, embora menos extensas, para tentar obter acesso a seus sites. Outros sites governamentais dos Estados Unidos também foram alvo de técnicas semelhantes.
Muitos dos incidentes de segurança envolvendo agentes que se tornaram públicos ocorreram com modelos internos da OpenAI que nunca tiveram previsão de lançamento.
Na semana passada, a OpenAI também informou que havia interrompido o treinamento de seus modelos de IA mais capazes depois que um agente conseguiu passar por uma brecha nas restrições de acesso à internet da empresa e consultar um chatbot público.
Segundo a companhia, os novos sistemas de monitoramento detectaram o incidente em 15 minutos. O treinamento desses modelos continua pausado.
A OpenAI, porém, afirma que o GPT-6.1 Astra é um caso diferente e não faz parte dos modelos cujo treinamento foi interrompido.
O episódio mostra que, para a empresa, aumentar a capacidade dos modelos não é mais a única preocupação antes de um lançamento. Os sistemas também precisam demonstrar comportamento suficientemente seguro e alinhado durante os testes internos.
O post OpenAI desiste de lançamento de novo modelo de inteligência artificial após problemas de segurança apareceu primeiro em Olhar Digital.
Comments
Post a Comment