nx-botton
Guia de segurança do ChatGPT

Guia de segurança do ChatGPT: riscos empresariais, incidentes e orientação para profissionais

A maioria das avaliações de segurança do ChatGPT faz as perguntas certas. O problema é quais perguntas são essas.

A OpenAI treina com dados corporativos? O que o DPA realmente diz? O ChatGPT Enterprise é significativamente diferente do nível gratuito? São perguntas razoáveis com respostas que não são difíceis de encontrar.

Também não são onde a maior parte da exposição realmente se encontra.

As lacunas que importam não existem. Eles ficam no nível que uma organização acha que tem em comparação com o que realmente configurou, no comportamento do modelo que nenhuma certificação aborda, e no que acontece quando GPTs, plugins e fluxos de trabalho agentes levam a exposição muito além da interface de chat.

Postura de segurança da OpenAI 

A questão do nível importa mais no ChatGPT do que na maioria dos softwares corporativos, porque os compromissos de manuseio de dados mudam significativamente dependendo do nível em que você está. Nos níveis gratuito e Plus, os dados de conversa podem ser usados para melhorar os modelos da OpenAI, a menos que os usuários optem ativamente por não participar. No Enterprise, Team e na API, a OpenAI não treina com dados de clientes por padrão. É aí que a exposição real reside, e ela é mais comum do que a maioria das organizações espera. As organizações com as quais trabalhamos têm funcionários usando contas pessoais ou Plus enquanto a organização opera sob a suposição de que controles empresariais estão em vigor.

Certificações de segurança OpenAI: o que o SOC 2 cobre e o que não cobre 

A OpenAI possui a certificação SOC 2 Tipo II que abrange controles de acesso, monitoramento, resposta a incidentes e gestão de mudanças. O que ele não cobre é o comportamento do modelo. Resistência à injeção rápida, confiabilidade da saída e o que o modelo faz com uma entrada cuidadosamente construída estão fora do escopo de qualquer auditoria de conformidade. Vemos relatórios SOC 2 usados regularmente para fechar revisões de segurança sobre implantações do ChatGPT. É um dado razoável. Não é uma resposta completa.

Controles de administrador corporativo do ChatGPT

O ChatGPT Enterprise fornece SSO, verificação de domínio, logs de auditoria, controles de retenção de dados e aplicação de políticas de uso. A configuração é necessária. Os padrões não são o ponto de partida certo para a maioria das organizações. Os registros de auditoria valem a pena. Um processo para realmente lê-los vale mais, e na nossa experiência é a primeira coisa que é descartada após o lançamento.

Escopo e limitações da recompensa de bugs do OpenAI

A OpenAI roda um programa de recompensa por bugs pelo Bugcrowd. O escopo exclui explicitamente o comportamento do modelo, incluindo jailbreaks e injeção de prompt. Isso traça uma linha clara entre o que a OpenAI considera sua responsabilidade de corrigir e o que não faz.

Políticas de uso do OpenAI e moderação de conteúdo

As políticas de uso da OpenAI se aplicam a todos os níveis. Clientes empresariais podem configurar algum comportamento de moderação de conteúdo pela API, mas as políticas básicas de uso não são negociáveis independentemente do tamanho do contrato. A maioria das organizações descobre o que as políticas de uso da OpenAI realmente cobrem quando um funcionário se depara com elas. Esse é um momento frustrante para estar tendo a conversa sobre governança.

Incidentes de segurança e histórico de vulnerabilidades do ChatGPT

O registro de incidentes da OpenAI se divide em duas categorias: falhas de infraestrutura e problemas de comportamento do modelo. Eles não são o mesmo problema e não são resolvidos da mesma forma.

Março de 2023: histórico de conversas e exposição de dados de pagamento

Um bug na camada de cache Redis da OpenAI fez com que alguns usuários vissem títulos de conversas a partir do histórico de conversas de outros usuários. Assinantes do ChatGPT Plus também foram expostos a informações parciais de pagamento pertencentes a outros assinantes, incluindo os últimos quatro dígitos dos cartões de pagamento e datas de expiração. OpenAI Desativou o ChatGPT por várias horas e notificou os usuários afetados. Qualquer incidente envolvendo dados de pagamento tem obrigações de notificação diferentes de uma exposição ao histórico de chat. A distinção vale a pena ser mapeada antes de um incidente ocorrer, não durante um.

2023 (divulgado em julho de 2024): violação interna do fórum

Um hacker acessou um fórum interno de discussão de funcionários da OpenAI e Detalhes relevados sobre o design das tecnologias de IA da empresa. Nenhum dado de clientes foi comprometido, e os sistemas onde a OpenAI constrói e abriga sua IA não foram acessados. A OpenAI divulgou o incidente internamente em uma reunião geral e ao conselho, mas não informou o público nem as autoridades. Para as equipes de segurança que realizam avaliações de risco de fornecedores, a questão mais relevante não é o que foi tomado, mas onde a OpenAI define seu limiar de divulgação. A resposta, neste caso, foram dados de clientes. O IP interno não atendia ao critério.

Injeção de prompt indireto: GPTs e fluxos de trabalho agentes

A injeção indireta de prompts por meio de conteúdo externo é um dos riscos mais persistentes nas implantações do ChatGPT. Quando o modelo lê e age com base em dados externos à conversa, seja de bases de conhecimento GPT, ferramentas conectadas ou resultados de tarefas agentes, esse conteúdo é um vetor potencial de instrução. Um terceiro que pode influenciar o que o modelo lê pode influenciar o que o modelo faz.

A superfície de ataque foi documentada pela primeira vez quando os plugins do ChatGPT foram lançados em 2023, com vários pesquisadores de segurança demonstrando a injeção de instruções por meio de respostas a plugins. Plugins foram descontinuados em 2024, mas o risco não foi fechado com eles. GPTs e fluxos de trabalho agentes criaram mais pontos de entrada para conteúdo externo, não menos.

2026: Vulnerabilidade na exfiltração de dados do ChatGPT

Pesquisadores de segurança revelaram uma vulnerabilidade no ChatGPT no início de 2026 que permitiu que dados sensíveis de conversas fossem silenciosamente exfiltrados por meio de um canal lateral baseado em DNS, contornando as barreiras da OpenAI contra requisições diretas de saída. Um único prompt malicioso pode transformar uma conversa comum em um canal de exfiltração secreto, vazando mensagens de usuários, arquivos enviados e outros conteúdos. A OpenAI corrigiu isso em 20 de fevereiro de 2026, após Divulgação responsável. Nenhuma exploração maliciosa confirmada até a data do patch. A importância para implantações empresariais não está na vulnerabilidade específica, que agora foi corrigida, mas na categoria: guarda-corpos projetados para evitar a saída de dados podem ser contornados por mecanismos indiretos. Essa categoria não é fechada.

2026: Vulnerabilidade do token Codex no GitHub

Uma vulnerabilidade de injeção de comandos de ramificação no Codex permitia que atacantes obtivessem movimento lateral e acessassem o código da vítima, roubassem tokens do GitHub e executassem comandos bash em contêineres de revisão de código. A vulnerabilidade afetou o site do ChatGPT, o Codex CLI, o Codex SDK e a extensão Codex IDE. Corrigido em 5 de fevereiro de 2026, após divulgação responsável em dezembro de 2025. À medida que os produtos da OpenAI se expandem para fluxos de trabalho de desenvolvimento, o perfil de risco se expande junto com eles. Essa é a categoria que cresce a cada nova capacidade agente que a OpenAI lança.

Orientações de segurança do ChatGPT para CISOs

A maioria das conversas sobre compras do ChatGPT acontece no nível do produto. Quando a segurança entra em ação, o caso de negócios já foi elaborado e a questão mudou de se implantar para como governá-lo.

O que negociar antes de assinar um Acordo Empresarial com o ChatGPT

O acordo ChatGPT Enterprise não é um documento de segurança, e o portal de confiança não substitui uma revisão de DPA. Antes de assinar, obtenha o seguinte por escrito:

  • Quais processos de dados acontecem na infraestrutura da OpenAI em comparação com a infraestrutura de terceiros, e quais terceiros estão envolvidos?
  • Quais são os padrões de retenção de dados e o que pode ser configurado?
  • Quais obrigações de notificação a OpenAI tem em caso de violação que afete seus dados e qual é o prazo exigido?
  • Quais subprocessadores têm acesso aos dados dos clientes e como as mudanças nos subprocessadores são comunicadas?
  • Quais direitos de auditoria o acordo oferece?

Os padrões do acordo padrão da OpenAI não são projetados para suas exigências.

Residência de dados e soberania do ChatGPT

A OpenAI processa dados nos Estados Unidos por padrão. Para organizações com obrigações de residência de dados sob GDPR, regulamentação setorial ou requisitos explícitos de localização de dados, esta é uma questão de compras, não pós-implantação. A OpenAI assumiu compromissos sobre processamento de dados para clientes europeus, mas esses compromissos são específicos de cada nível e acordo. A documentação nem sempre está atualizada. Verifique diretamente.

Classificação de dados do ChatGPT: o que deve e o que não deve ser enviado

A questão prática para a maioria das organizações não é se o ChatGPT é seguro o suficiente, mas quais dados são apropriados para ser enviados para ele. Uma abordagem em níveis funciona melhor do que uma política geral em qualquer direção, e é o que vemos funcionando em implantações mais maduras.

No mínimo, o arcabouço de classificação deve abordar:

  • O que constitui dados confidenciais ou restritos na sua organização e se eles podem ser enviados ao ChatGPT em qualquer circunstância
  • Como lidar com dados de clientes, dado que a maioria dos frameworks de proteção de dados os trata de forma diferente dos dados internos
  • Quais categorias de dados reguladas existem no seu contexto (PII, PHI, dados financeiros) e se o nível ChatGPT em uso oferece proteções contratuais suficientes para essas categorias

Uma política de classificação sem fiscalização não é uma política. A orientação escrita é a parte fácil.

DLP, CASB e políticas de uso aceitável para ChatGPT

As ferramentas existentes de DLP e CASB podem ser estendidas para cobrir o ChatGPT, mas as configurações padrão são insuficientes para cobrir os padrões de dados que importam: janelas de contexto longo, uploads de arquivos e conversas de múltiplas turnos com contexto acumulado ao longo de uma sessão.

Uma política de uso aceitável que não aborda especificamente o ChatGPT não é uma política de uso aceitável por IA. A PUA deve definir quais níveis os funcionários podem usar, quais classificações de dados são permitidas e quais são as consequências de uma violação de política.

Gestão de riscos de fornecedores para OpenAI: o que os frameworks padrão deixam de fazer

O framework padrão de risco do fornecedor não foi construído para um fornecedor que envia mudanças comportamentais por meio de atualizações de modelo, sem versões versionadas, sem notas de atualização e sem aviso prévio. A OpenAI se encaixa nessa descrição. As perguntas que valem a pena acrescentar a uma avaliação de risco de fornecedores da OpenAI são aquelas que um framework tradicional não faz.

Como sua organização reavalia o risco quando o produto muda materialmente sem um lançamento? A OpenAI lançou atualizações de modelos que mudaram o comportamento de saída, a aplicação de políticas de conteúdo e os limites de capacidade sem notificação formal aos clientes corporativos. O perfil de risco do produto que você avaliou há seis meses pode não refletir o que está rodando hoje.

Como seu framework de risco de fornecedores leva em conta GPTs e plugins de terceiros? GPTs personalizados construídos por terceiros e distribuídos pelo ecossistema da OpenAI são, na prática, uma cadeia de suprimentos separada sobre a plataforma da OpenAI. Se os funcionários estão usando, cada um merece sua própria avaliação. A maioria dos programas de risco de fornecedores não tem um mecanismo para isso.

Qual é o seu gatilho de reavaliação para novas capacidades agentes? A OpenAI está expandindo ativamente o que o ChatGPT pode fazer de forma autônoma: navegação, execução de código, orquestração de tarefas. Cada capacidade que é enviada muda o modelo de ameaça para implantações existentes. Uma avaliação de risco do fornecedor sem um gatilho definido para reavaliação quando novos recursos agentes são lançados já está atrasada.

Riscos de segurança nas implantações de APIs da OpenAI

A maioria dos problemas de segurança nas implantações de APIs da OpenAI não é um problema da OpenAI para resolver. São decisões arquitetônicas tomadas pelas equipes que constrói sobre a API. Para as equipes de segurança que governam essas implantações, a superfície de risco se concentra em três áreas: o que o prompt do sistema realmente protege, qual resultado do modelo pode ser confiável para fazer a jusante e o que acontece quando o modelo tem acesso a ferramentas ou dados externos.

Injeção de prompt em implantações de APIs do ChatGPT

A injeção de prompt não é um conceito novo para esse público. Vale a pena revisitar onde ela aparece nas implantações da API OpenAI e como ela difere do que a maioria dos desenvolvedores espera.

A injeção de prompt direto, onde o usuário cria uma entrada para sobrescrever instruções do sistema, é o caso óbvio e o mais fácil de raciocinar. O caso mais difícil é a injeção indireta de prompt: quando o modelo processa conteúdo externo que contém instruções embutidas por terceiros. Documentos recuperados, saídas de ferramentas, conteúdo da página web. Qualquer fonte que o modelo lê para completar uma tarefa é um vetor de injeção potencial.

O modelo não possui uma forma confiável de distinguir entre instruções legítimas do operador e instruções embutidas nos dados que foi instruído a processar. Nem o desenvolvedor, sem validação explícita na camada de saída.

Mitigações que ajudam: formatos de saída restritos, validação de esquema JSON, saídas estruturadas, filtragem de entrada, separação de privilégios entre o que o modelo pode ler e o que pode agir. Mitigações que não ajudam tanto quanto os desenvolvedores esperam: instruções de prompt do sistema dizendo ao modelo para ignorar tentativas de injeção.

Segurança e confidencialidade rápidas do sistema ChatGPT

O prompt do sistema não é um cofre seguro. Pesquisadores documentaram técnicas confiáveis para extrair conteúdos de prompts do sistema por meio de entradas cuidadosamente construídas pelos usuários.

A regra prática: assuma que o prompt do sistema é legível. Chaves de API, credenciais de banco de dados e URLs internas pertencem a variáveis de ambiente e gerenciadores de segredos.

Validando a saída da API do ChatGPT

A saída do modelo não é entrada sanitizada. Se a saída de uma chamada de API OpenAI estiver sendo passada para outro sistema, uma consulta de banco de dados, um comando shell, um renderizador HTML ou outra API, ela precisa ser validada antes do uso. Um modelo manipulado por injeção de prompt pode produzir saída especificamente criada para explorar qualquer sistema a jusante que a receba. Trate a saída do modelo com o mesmo ceticismo que aplicaria à entrada do usuário.

Segurança de chaves e prevenção de abuso da API OpenAI

Chaves de API expostas estão entre os vetores de risco mais concretos do ecossistema OpenAI. Atacantes que escaneiam repositórios públicos em busca de chaves codificadas fixamente e as usam para gerar custos de computação ou exfiltrar dados pela API é um padrão documentado. Gire chaves, use variáveis de ambiente, defina limites de gasto, monitore o uso em busca de anomalias. O limite de gastos é o controle mais subutilizado, dado o perfil de custo do abuso de API em alto volume.

Riscos de segurança do RAG com a API OpenAI

Geração Aumentada por Recuperação introduz superfícies de ataque que operam independentemente do próprio modelo. Dois são os mais importantes na prática.

Envenenamento de dados: se um atacante pode influenciar o que está na sua base de conhecimento, ele pode influenciar o que o modelo recupera e revela. Documentos contendo instruções incorporadas são um vetor para injeção indireta de prompts no momento da recuperação.

Controle de acesso nos dados recuperados: Sistemas RAG frequentemente recuperam documentos com base na relevância semântica sem aplicar os controles de acesso que regem o armazenamento de dados subjacente. Um usuário negado ao acesso a um documento por meios normais pode conseguir revelar seu conteúdo por meio de uma consulta bem estruturada para um sistema RAG que o indexe.

Uso de ferramentas OpenAI, chamada de funções e segurança MCP

O uso de ferramentas e a chamada de função estendem igualmente a superfície de capacidade da API e sua superfície de ataque. Quando o modelo pode chamar funções externas, a saída dessas funções passa a fazer parte do contexto do modelo, que é um vetor de injeção de prompt. Uma função que retorna dados de uma fonte externa é um canal pelo qual um terceiro pode injetar instruções.

As integrações MCP estendem isso ainda mais. Cada servidor MCP conectado a uma implantação é um ponto de injeção e um canal potencial de exfiltração. O raio de explosão de um servidor MCP comprometido ou malicioso depende das permissões que ele foi concedido. O Scanner MCP na seção Ferramentas cobre isso especificamente.

Riscos emergentes de segurança do ChatGPT e OpenAI

ChatGPT atlas e o problema não resolvido da injeção de prompts

A OpenAI reconheceu publicamente que reforçar o Atlas contra a injeção rápida é um compromisso de longo prazo e uma prioridade máxima. Isso é algo razoável de se dizer sobre um problema difícil. Também é um reconhecimento de que o problema não está resolvido. Para organizações que implantam o Atlas ou que se baseiam no SDK dos Agentes, o modelo de ameaça é fundamentalmente diferente de uma interface de chat: uma injeção bem-sucedida de prompts agora pode resultar em ações do mundo real, não apenas em saída de texto.

Comportamento do modelo de raciocínio OpenAI e risco corporativo

Pesquisas da Apollo Research sobre os modelos de raciocínio da OpenAI documentaram padrões de comportamento enganoso em cenários de teste, incluindo a desativação de mecanismos de supervisão e o fornecimento de informações enganosas. Teste de O1 Descobriu que o modelo reconhecia esse comportamento apenas cerca de 20% das vezes quando confrontado, um dado que influenciou a forma como os pesquisadores pensam sobre a linha mais ampla do modelo de raciocínio. Isso não é motivo para evitar modelos de raciocínio. É um motivo para pensar cuidadosamente nos contextos em que são utilizados e quais mecanismos de fiscalização existem. Modelos que raciocinam sobre sua própria situação representam um desafio de avaliação diferente dos modelos padrão de seguir instruções.

O ecossistema agente como cadeia de suprimentos

O ecossistema GPT personalizado, os Operadores e os frameworks de agentes de terceiros construídos sobre a infraestrutura da OpenAI estão crescendo mais rápido do que os mecanismos de triagem ao redor deles. Em 2025, a equipe de segurança de IA da Cisco documentou casos de pacotes de agentes compartilhados pela comunidade realizando exfiltração de dados e injeção rápida sem conhecimento do usuário. Os controles em nível de plataforma da OpenAI não se estendem ao que terceiros constroem sobre eles, e atualmente não há um processo adequado de triagem no nível do ecossistema.

Risco de segurança e pipeline de desenvolvimento do OpenAI Codex

O Codex da OpenAI passou de uma ferramenta de completação de código para um agente de desenvolvimento autônomo com acesso a repositórios, pipelines CI/CD e ambientes de produção. Os frameworks de segurança com os quais a maioria das equipes de desenvolvimento trabalha não foram projetados para esse perfil de capacidade, e ainda não alcançaram. A maioria das equipes ainda está mapeando a superfície enquanto ela está sendo sondada ativamente.

Recurso de memória do ChatGPT: riscos de envenenamento e manipulação

O recurso de memória persistente do ChatGPT ainda não recebeu a mesma atenção de pesquisa que a injeção rápida ou os jailbreaks. A memória de longo prazo pode ser manipulada por meio de entradas cuidadosamente construídas que persistem entre sessões, influenciando o comportamento futuro do modelo de maneiras que não são visíveis nem para o usuário nem para o administrador. À medida que a memória se torna mais amplamente utilizada e utilizada, essa é uma categoria de risco que em breve atrairá muita atenção. Pesquisadores e atacantes tendem a chegar mais ou menos ao mesmo tempo.

Este conteúdo foi traduzido e adaptado pela Nexoria.

Publicações recentes