NEWS Anunciamos US$ 3,2M em rodada pré-seed · OneVC · Maya · Norte Ventures Leia →
Voltar ao blog

Onde o seu dado fica
quando a empresa usa IA

TL;DR: Em uma arquitetura de contexto bem desenhada, os dados permanecem na infraestrutura do cliente, em nuvem privada ou ambiente local, e apenas o trecho necessário para produzir a resposta trafega até o provedor do modelo em cada consulta. O dado não é copiado para dentro do modelo nem usado para treiná-lo. Mapear esse fluxo de forma explícita é o que permite passar pela revisão de segurança.

O que realmente trava projetos em setor regulado

Não é a capacidade do modelo. É a incapacidade de responder com precisão a cinco perguntas:

  1. Qual informação sai do nosso ambiente em cada consulta?
  2. O provedor armazena esse conteúdo e por quanto tempo?
  3. Esse conteúdo é usado para treinar modelos?
  4. Onde fica fisicamente a infraestrutura que processa a consulta?
  5. Conseguimos demonstrar tudo isso em auditoria?

Times que chegam à reunião de segurança com resposta clara para as cinco avançam mais rápido do que times que chegam com uma demonstração impressionante.

O mapa que segurança vai pedir

ElementoOnde ficaSai do perímetro?
Base de dados de origemAmbiente do clienteNão
Índice de busca e metadadoAmbiente do clienteNão
Log de consultas e auditoriaAmbiente do clienteNão
Trecho de contexto da consultaRecuperado no ambienteSim, no momento da chamada
Pergunta do usuárioAmbiente do clienteSim, no momento da chamada
Resposta geradaProvedorRetorna ao ambiente

O que sai em cada consulta é o trecho de contexto recuperado mais a pergunta do usuário, e nunca a base. Esse desenho é o que sustenta a afirmação de que o dado não é copiado para dentro do modelo.

Três topologias possíveis

Camada no ambiente do cliente, modelo via API. Cobre a maioria dos casos corporativos. Dado e índice ficam dentro, a inferência acontece fora com envio apenas do recorte. Combina controle do dado com acesso aos modelos mais capazes sem operar infraestrutura de inferência.

Camada e modelo no ambiente do cliente. Nada sai do perímetro. Exige operar GPU, atualizar versão de modelo e assumir a disponibilidade da inferência.

Camada no cliente, modelo em região dedicada. Meio-termo para restrição geográfica, com processamento em região definida e contrato específico.

A escolha depende da regulação aplicável e da criticidade do dado, e não precisa ser uniforme. É comum ter tarefas críticas em um desenho e o restante em outro.

O que significa "apenas o trecho necessário"

Quando alguém pergunta sobre a situação de um cliente específico, a camada recupera o conjunto de informação relacionado àquela conta e envia só isso ao modelo. A base de clientes inteira permanece onde estava.

Isso tem dois efeitos simultâneos: reduz a superfície de exposição em cada chamada e reduz o custo, porque menos conteúdo processado significa menos token consumido. O desenho oposto, que envia contexto amplo por precaução, aumenta risco e custo ao mesmo tempo.

Como reduzir ainda mais o que sai

  • Recorte preciso. Enviar o trecho que responde, e não o documento inteiro.
  • Pseudonimização. Substituir identificadores diretos por referências quando a tarefa não exige identificação, remontando os nomes na resposta, dentro do perímetro.
  • Classificação prévia. Marcar campos por sensibilidade e bloquear categorias que nunca devem sair.
  • Política por tipo de tarefa. Formatação e resumo geralmente precisam de menos dado identificável do que parece.

Exemplo aplicado

Uma instituição financeira de médio porte tinha um projeto parado havia sete meses na revisão de segurança. A proposta original previa replicar a base de clientes para o ambiente do fornecedor.

O redesenho manteve a base onde estava, dentro da nuvem privada da instituição, com a camada de contexto rodando no mesmo ambiente e a permissão de cada usuário aplicada na recuperação. Para o provedor do modelo, passou a trafegar apenas o trecho de contexto de cada consulta, com pseudonimização de identificadores quando a tarefa não exigia identificação.

A aprovação saiu em seis semanas, depois de uma demonstração que mostrava, na captura de rede, exatamente o que era enviado em uma consulta real. A discussão saiu do plano das promessas e passou para evidência observável.

O que colocar no contrato com o provedor de modelo

  • Ausência de uso do conteúdo enviado para treinamento.
  • Prazo de retenção do conteúdo, com preferência por retenção zero quando disponível.
  • Região de processamento.
  • Subprocessadores e política de notificação de mudança.
  • Certificações e possibilidade de auditoria.

Vale exigir isso por escrito, porque a política pública de um provedor pode diferir do plano contratado.

Requisitos operacionais de rodar dentro do ambiente

Quem escolhe manter a camada no próprio ambiente assume responsabilidades que valem estar claras desde o começo:

  • disponibilidade e escalonamento da camada, tratada como serviço de produção;
  • atualização de dependências e correção de vulnerabilidade;
  • monitoramento de recuperação e de latência;
  • gestão de segredo e rotação de credencial das fontes;
  • comportamento definido quando o provedor de modelo estiver indisponível, com mensagem clara em vez de resposta parcial.

O último item é o mais esquecido e o que mais gera incidente operacional.

O Company Brain da Strattum roda dentro da infraestrutura do cliente justamente por isso: o dado permanece no ambiente e apenas o trecho necessário trafega em cada consulta.

Perguntas frequentes

Rodar o modelo localmente é sempre mais seguro?

Elimina o tráfego externo e transfere para a empresa a responsabilidade de operar, atualizar e proteger a infraestrutura de inferência. É a escolha certa quando a regulação exige, e não por padrão.

Pseudonimização sempre funciona?

Funciona quando a tarefa não depende da identidade. Em análise que exige nome ou documento, o controle vem da topologia e do contrato.

E os dados que já circularam em testes?

Vale levantar o que foi enviado na fase de experimentação e verificar a política de retenção do provedor para aquele período.

Como demonstrar isso em auditoria?

Com o mapa de fluxo por tipo de consulta, o log de recuperação e uma captura mostrando o conteúdo efetivamente enviado em chamadas reais.

Desenhe a arquitetura que passa na revisão.

Fale com um especialista da Strattum sobre onde seus dados ficam e o que trafega até o modelo.