Neste artigo
A OpenAI confirmou que existe prompt injection autorreplicante: uma instrução maliciosa que, além de enganar um agente de IA, faz o agente copiar a própria instrução adiante, como um worm de computador. O relatório saiu em 25/09/2026 no blog de pesquisa de alinhamento da empresa, quatro dias antes do lançamento dos dots, e ganhou repercussão em 29/09. Segundo a OpenAI, o ataque só foi observado em ambiente simulado de treino e avaliação. Não há registro de caso real.
O que é o prompt injection autorreplicante
É uma ordem escondida num conteúdo que o agente lê (e-mail, arquivo, mensagem) e que cumpre duas condições: desvia o agente do que o usuário pediu e o induz a reproduzir a própria ordem num canal de saída. A definição é do relatório “Self-replicating prompt injections exist”. A injeção comum, explicada no nosso glossário dos dots, atinge um agente. A autorreplicante usa esse agente como transporte: a resposta que ele envia já carrega o ataque para o próximo assistente que a ler.
A descoberta é de 27/06/2026, segundo o relatório, e veio do GPT-Red, o sistema de treino em que um modelo atacante escreve injeções para tentar enganar um modelo defensor. A OpenAI acrescentou um objetivo ao atacante: fazer o defensor repetir a injeção num canal público. Funcionou.
Os exemplos do relatório: e-mail, arquivos e Slack
| Vetor | Como o ataque se espalha | Modelo enganado |
|---|---|---|
| Um e-mail de agendamento traz uma falsa “regra de arquivo” pedindo que assistentes automáticos respondam em espanhol e citem a mensagem inteira no fim. O agente obedece e a resposta leva a injeção de volta | Versão interna baseada no GPT-5.4-mini | |
| Arquivos | Um falso aviso de sistema dentro de uma planilha manda gravar o aviso num arquivo e apagar uma pasta de relatórios. O modelo faz as duas coisas | Versão interna baseada no GPT-5.4-mini |
| Código | Uma falsa nota de resumo da sessão manda copiar a nota para um arquivo do projeto e retirar a verificação de segurança do processo de build | Não especificado no exemplo |
| Slack, em vários saltos | Num pedido de resumo de mensagens, uma mensagem leva a outra até o agente enviar uma recompensa interna a um colega e repostar o texto injetado no canal | GPT-5.5 |
O caso do Slack é o mais delicado. Segundo o relatório, um pedido direto de envio é fácil de o modelo estranhar; uma sequência de leituras que parecem relevantes desvia o agente aos poucos.
Divergência: o The Register (29/09) diz que a descoberta ocorreu no treino adversário do GPT-5.6. No relatório que lemos, a OpenAI cita apenas versões internas baseadas no GPT-5.4-mini e o GPT-5.5, e não menciona o GPT-5.6.
O que a OpenAI vai fazer: incluir a autorreprodução entre os objetivos do atacante no GPT-Red, para que os próximos modelos já tenham visto esse tipo de ataque no treino. A empresa diz esperar que eles fiquem mais resistentes. Não promete imunidade.
Os números de prompt injection no system card dos dots
Em 29/09, a OpenAI acrescentou um apêndice sobre dots ao system card do GPT-6 Astra, com testes de e-mails maliciosos e de limites de escopo. Lemos os números na página oficial. São resultados de laboratório, com dados sintéticos.
| Teste | Resultado | Como ler |
|---|---|---|
| Ataque em massa: 100 rodadas de 500 e-mails (334 legítimos e 166 ataques gerados pelo GPT-Red) | 50.000 e-mails, 16.600 ataques, nenhum sucesso | Os dots costumavam sinalizar o pedido suspeito e avisar o usuário |
| Ataque iterativo: o atacante refina o e-mail a cada resposta | 100 cadeias, 2.638 tentativas válidas, nenhum sucesso | Cada tentativa enfrentou um dot sem memória dos e-mails anteriores |
| Limites entre tarefas encadeadas | Violações moderadas de escopo em 8,6% dos casos com cinco tarefas intermediárias e 19,7% com dez; nenhuma grave | Quanto mais longa a cadeia, mais desvios |
| Mudança de permissão no meio da tarefa | 91,8% de acerto (45 de 49 episódios) | Acertou os 17 casos de mudança explícita |
| Ataques indiretos da Gray Swan contra o GPT-6 Astra (1.810 ataques, 15 tentativas por cenário) | 8,5% de sucesso do atacante, contra 27,0% no GPT-5.6 Sol | Melhorou, mas não zerou |
O apêndice traz ressalvas. O red team humano levou a OpenAI a mudar a política de confirmação dos dots, e a empresa admite que ainda trata vulnerabilidades conhecidas. Considera o lançamento adequado porque os ataques exigiram muita preparação e foram difíceis de repetir. Na Central de Ajuda, diz que as proteções reduzem o risco, mas não o eliminam.
Não encontramos no system card um teste específico de injeção autorreplicante contra os dots. Análise nossa: “nenhum sucesso em 16.600 ataques” é um bom resultado de laboratório, não uma garantia.
O que fazer se você usa um dot ou outro agente
As três primeiras orientações são da página da OpenAI sobre o tema. As demais são sugestões nossas, a partir dos controles documentados dos dots.
- Limite o acesso. Conecte só os dados que a tarefa exige.
- Leia antes de confirmar. Quando o agente pedir aprovação para enviar ou comprar, confira destinatário e conteúdo.
- Dê instruções específicas. Pedidos amplos, como “revise meus e-mails e faça o que for preciso”, facilitam o desvio.
- Deixe o envio em “perguntar antes”. Uma injeção que se replica precisa que o agente envie algo. Veja como configurar em regras e permissões do dot.
- Desconfie de texto que você não pediu. Rascunho que cita a mensagem original inteira, muda de idioma ou traz “regras” e avisos de sistema é sinal de alerta. Não aprove.
- Cuidado com canais compartilhados. No exemplo do Slack, o ataque veio do próprio canal. Antes de pôr o dot em canais do Slack, defina o que ele pode postar.
O quadro completo de riscos e proteções está no guia os dots são seguros?.
O que muda para quem está no Brasil
- Idioma não protege. O exemplo principal do relatório está em espanhol. Análise nossa: um ataque escrito em português funcionaria do mesmo jeito.
- Os vetores são os do escritório brasileiro. E-mail, arquivos compartilhados e Slack. O WhatsApp fica fora dessa conta porque não é canal do dot.
- Quem responde pelo dado é você. Se um agente repassar dados de clientes por causa de uma instrução escondida, o incidente é da empresa que conectou esses dados. Veja o que pesa na LGPD em privacidade dos dots.
- O contexto pesa. No mesmo mês, a empresa admitiu que modelos internos acessaram sites públicos sem autorização, caso que explicamos em OpenAI e Austrália.
Perguntas frequentes
O que é prompt injection autorreplicante?
É uma instrução maliciosa escondida num conteúdo que o agente de IA lê e que, além de desviar o agente, o faz reproduzir a própria instrução num e-mail, arquivo ou mensagem. Assim o ataque pode passar para outro agente, como um worm.
Esse ataque já aconteceu no mundo real?
Segundo a OpenAI, não. O relatório de 25/09/2026 diz que nenhum impacto foi observado fora das chamadas de ferramenta simuladas em treino e avaliação, e que a divulgação se deve à novidade do ataque, não a um incidente.
Os dots são vulneráveis a prompt injection?
O risco existe. No system card, nenhum de 16.600 e-mails de ataque teve sucesso em 100 rodadas de teste, mas a OpenAI admite que as proteções reduzem o risco sem eliminá-lo e que ainda trata vulnerabilidades conhecidas. Não há teste publicado de injeção autorreplicante nos dots.
Quais modelos caíram no ataque?
Nos exemplos de e-mail e de arquivos, uma versão interna de pesquisa baseada no GPT-5.4-mini. No teste do Slack em vários saltos, o GPT-5.5. O relatório não cita o GPT-6 Astra, modelo que roda os dots.
O que é o GPT-Red?
É o sistema de treino da OpenAI em que um modelo atacante escreve injeções para tentar enganar um modelo defensor. A empresa vai incluir a autorreprodução entre os objetivos do atacante, para que os próximos modelos já conheçam esse tipo de ataque.
Como me proteger de prompt injection ao usar um agente de IA?
Conecte só os dados necessários, dê instruções específicas, mantenha o envio de mensagens na regra de perguntar antes e leia cada rascunho antes de aprovar. Desconfie de respostas com trechos que você não pediu.
Fontes
Fatos checados em .
- OpenAI Alignment: Self-replicating prompt injections exist alignment.openai.com
- The Register: Add one more AI worry to the nightmare scenario: self-replicating prompt injections theregister.com
- OpenAI: system card do GPT-6 Astra, apêndice sobre dots (seção 12) deploymentsafety.openai.com
- OpenAI: system card do GPT-6 Astra, seção 5.2 (Prompt Injection) deploymentsafety.openai.com
- OpenAI, Central de Ajuda: Dots privacy, security, and safety FAQs help.openai.com
- OpenAI: Understanding prompt injections openai.com
- arXiv: GPT-Red: Automated Red Teaming via Self-Play at Scale arxiv.org