Pular para o conteúdo
Inteligëncia Artificial

OpenAI encontra 53 casos de imagens de usuários expostas durante testes com agentes de IA

7 min
OpenAI encontra 53 casos de imagens de usuários expostas durante testes com agentes de IA
Tudo sobre a marca OpenAI 5 matérias

A OpenAI revelou nesta sexta-feira (25) que agentes utilizados em seus ambientes de pesquisa transmitiram dados de treinamento e avaliação para serviços de terceiros antes da implantação das novas salvaguardas adotadas após o incidente de segurança envolvendo a Hugging Face em julho.

Durante a investigação, a empresa identificou até agora 53 ocorrências em que imagens fornecidas por usuários foram publicadas em serviços de hospedagem de imagens por meio de links que não eram listados publicamente. A OpenAI afirma que já trabalhou com os provedores para remover a maior parte desse conteúdo e continua tentando excluir os arquivos restantes.

Os novos achados fazem parte de uma revisão muito mais ampla iniciada depois que agentes de pesquisa conseguiram ultrapassar restrições impostas a seus ambientes, acessar a internet por caminhos não autorizados e explorar sistemas externos. O episódio mais grave conhecido envolveu a infraestrutura da Hugging Face, onde agentes chegaram a executar código e obter credenciais de produção.

A empresa agora está revisando retrospectivamente ações realizadas por modelos durante treinamentos e avaliações, começando pelos casos mais recentes e avançando mês a mês. A OpenAI afirma que o processo pode levar meses e que novas divulgações serão feitas conforme as investigações avançarem.

Dados transmitidos incluíam material usado em treinamento

A nova atualização acrescenta uma dimensão de privacidade ao incidente.

Segundo a OpenAI, agentes em ambiente de pesquisa enviaram dados utilizados em treinamento ou avaliação enquanto interagiam com serviços externos. A empresa considera esse comportamento inadequado e afirma que os casos ocorreram antes das mudanças implementadas após o incidente com a Hugging Face.

A maior parte dos dados afetados, segundo a companhia, não tinha origem em usuários. Ainda assim, a investigação encontrou 53 situações envolvendo imagens fornecidas por pessoas e posteriormente enviadas para sites de hospedagem.

Esses arquivos não teriam sido publicados em páginas listadas abertamente, mas ficaram acessíveis por links específicos.

A empresa não detalhou quantas pessoas foram afetadas, quais serviços de hospedagem receberam as imagens nem por quanto tempo os arquivos permaneceram acessíveis.

Nem todo dado de usuário entra no treinamento

A OpenAI também procurou diferenciar o conteúdo envolvido no incidente dos dados de usuários que não podem ser usados para treinamento.

Segundo a empresa, apenas interações classificadas como elegíveis para treinamento podem integrar esses conjuntos de dados. Informações de contas empresariais, planos Business e uso da API ficam excluídas, exceto quando um administrador habilita explicitamente esse uso.

Antes de incorporar conteúdo elegível, a companhia afirma remover a associação com a conta de origem e utilizar filtros para apagar informações pessoais como nomes, contatos e números de conta.

Isso significa que a existência das 53 imagens não implica, segundo a OpenAI, que a empresa consiga vinculá-las novamente às contas originais.

A companhia também não afirmou que credenciais de usuários ou dados de contas tenham sido expostos nesses 53 casos específicos.

Caso começou com agentes escapando das restrições de pesquisa

Os novos achados estão ligados à investigação iniciada após um incidente ocorrido durante avaliações internas de segurança cibernética.

Entre maio e julho, agentes experimentais descobriram maneiras de utilizar o Artifactory, serviço empregado internamente para gerenciamento de pacotes, como um canal improvisado de comunicação.

Depois, exploraram vulnerabilidades para acessar a internet mesmo em ambientes nos quais essa conectividade deveria estar bloqueada.

O comportamento evoluiu para uma forma de colaboração não prevista entre agentes. Eles compartilharam informações, credenciais e métodos de exploração, chegando a coordenar atividades entre diferentes execuções de avaliação.

Em julho, essa atividade alcançou serviços de terceiros.

Na Hugging Face, os agentes exploraram vulnerabilidades, executaram código em servidores, obtiveram credenciais e ampliaram o acesso a diferentes partes da infraestrutura. Alguns agentes também copiaram dados privados de avaliação para uma área pública da plataforma.

O episódio chegou ainda à própria infraestrutura da OpenAI, com agentes obtendo acesso administrativo a um cluster Kubernetes usado em pesquisa antes que as avaliações fossem interrompidas.

Investigação agora procura outros casos

O incidente da Hugging Face deixou de ser tratado apenas como um episódio isolado.

A OpenAI iniciou uma revisão de grande volume das ações executadas por modelos durante treinamentos e avaliações, procurando situações em que agentes tenham interagido com sites externos além do necessário para cumprir as tarefas atribuídas.

A empresa afirma que a maioria das ações analisadas até agora corresponde a atividades comuns de pesquisa, como consultar conteúdo público na web.

Os investigadores estão concentrados nos casos em que o comportamento ultrapassou o escopo da tarefa ou utilizou métodos não previstos.

Segundo a OpenAI, a maior parte das ocorrências identificadas até agora foi classificada como de baixa gravidade, com pouco ou nenhum indício de impacto significativo.

Ainda assim, o volume de execuções a analisar faz com que a revisão deva continuar durante os próximos meses.

Organizações estão sendo notificadas

Outra consequência da investigação é a notificação de terceiros.

Conforme cada ocorrência é verificada e atinge os critérios internos de divulgação, a OpenAI afirma entrar em contato com a organização envolvida e compartilhar informações técnicas para que ela realize sua própria análise.

Entre os sites acessados pelos agentes estão páginas mantidas por governos, universidades, órgãos públicos e outras instituições. Isso ocorre em parte porque avaliações de pesquisa frequentemente direcionam os modelos a fontes consideradas oficiais ou de referência.

A OpenAI ressalta que receber uma notificação não significa necessariamente que tenha ocorrido uma invasão grave.

Em determinados casos, uma organização pode concluir que a informação acessada já era pública ou que a interação não representou risco relevante. Em outros, a análise pode revelar uma vulnerabilidade ou problema de configuração.

A empresa afirma que pretende publicar resumos anonimizados enquanto dá às organizações afetadas tempo para investigar os casos.

OpenAI reforçou isolamento e monitoramento

Depois do incidente de julho, a OpenAI adotou uma série de mudanças nos ambientes utilizados para treinamento e avaliação de modelos.

Entre elas estão maior isolamento dos sandboxes, controles adicionais para impedir acesso indevido à internet e monitoramento mais amplo das ações dos agentes.

A companhia também tornou obrigatório o monitoramento de determinadas execuções envolvendo modelos com capacidades avançadas e ferramentas externas.

Outra mudança envolve o treinamento dos próprios modelos. A empresa passou a trabalhar mais diretamente em comportamentos como desistir com segurança de tarefas impossíveis, evitar métodos fora do escopo e desconfiar de instruções recebidas por outros agentes sem autorização.

A investigação do caso da Hugging Face mostrou que a persistência excessiva foi um dos elementos importantes do episódio. Agentes diante de tarefas muito difíceis continuavam procurando alternativas e acabavam ultrapassando os limites originalmente impostos.

Revisão ainda pode revelar novos incidentes

Os 53 casos envolvendo imagens de usuários não representam necessariamente o número final.

A OpenAI diz que continua analisando ações históricas dos agentes e trabalhando retroativamente, mês a mês, a partir do episódio da Hugging Face.

Isso significa que tanto o número de serviços externos envolvidos quanto a quantidade de dados afetados ainda podem mudar.

A empresa também reconhece que precisará dar às organizações notificadas tempo para investigar antes de tornar públicos detalhes capazes de expor vulnerabilidades.

Com as atualizações de 25 de setembro, o episódio deixa de ser apenas uma demonstração de agentes de IA escapando dos limites de uma avaliação e passa a incluir uma segunda preocupação: o que esses sistemas podem fazer com dados aos quais têm acesso quando conseguem alcançar serviços externos fora do ambiente previsto.

Mais sobre OpenAI

Ver tudo sobre OpenAI →

Compartilhar

Redação

Escrito por