TL;DR: Em uma arquitetura de contexto bem desenhada, os dados permanecem na infraestrutura do cliente, em nuvem privada ou ambiente local, e apenas o trecho necessário para produzir a resposta trafega até o provedor do modelo em cada consulta. O dado não é copiado para dentro do modelo nem usado para treiná-lo. Mapear esse fluxo de forma explícita é o que permite passar pela revisão de segurança.
Não é a capacidade do modelo. É a incapacidade de responder com precisão a cinco perguntas:
Times que chegam à reunião de segurança com resposta clara para as cinco avançam mais rápido do que times que chegam com uma demonstração impressionante.
| Elemento | Onde fica | Sai do perímetro? |
|---|---|---|
| Base de dados de origem | Ambiente do cliente | Não |
| Índice de busca e metadado | Ambiente do cliente | Não |
| Log de consultas e auditoria | Ambiente do cliente | Não |
| Trecho de contexto da consulta | Recuperado no ambiente | Sim, no momento da chamada |
| Pergunta do usuário | Ambiente do cliente | Sim, no momento da chamada |
| Resposta gerada | Provedor | Retorna ao ambiente |
O que sai em cada consulta é o trecho de contexto recuperado mais a pergunta do usuário, e nunca a base. Esse desenho é o que sustenta a afirmação de que o dado não é copiado para dentro do modelo.
Camada no ambiente do cliente, modelo via API. Cobre a maioria dos casos corporativos. Dado e índice ficam dentro, a inferência acontece fora com envio apenas do recorte. Combina controle do dado com acesso aos modelos mais capazes sem operar infraestrutura de inferência.
Camada e modelo no ambiente do cliente. Nada sai do perímetro. Exige operar GPU, atualizar versão de modelo e assumir a disponibilidade da inferência.
Camada no cliente, modelo em região dedicada. Meio-termo para restrição geográfica, com processamento em região definida e contrato específico.
A escolha depende da regulação aplicável e da criticidade do dado, e não precisa ser uniforme. É comum ter tarefas críticas em um desenho e o restante em outro.
Quando alguém pergunta sobre a situação de um cliente específico, a camada recupera o conjunto de informação relacionado àquela conta e envia só isso ao modelo. A base de clientes inteira permanece onde estava.
Isso tem dois efeitos simultâneos: reduz a superfície de exposição em cada chamada e reduz o custo, porque menos conteúdo processado significa menos token consumido. O desenho oposto, que envia contexto amplo por precaução, aumenta risco e custo ao mesmo tempo.
Uma instituição financeira de médio porte tinha um projeto parado havia sete meses na revisão de segurança. A proposta original previa replicar a base de clientes para o ambiente do fornecedor.
O redesenho manteve a base onde estava, dentro da nuvem privada da instituição, com a camada de contexto rodando no mesmo ambiente e a permissão de cada usuário aplicada na recuperação. Para o provedor do modelo, passou a trafegar apenas o trecho de contexto de cada consulta, com pseudonimização de identificadores quando a tarefa não exigia identificação.
A aprovação saiu em seis semanas, depois de uma demonstração que mostrava, na captura de rede, exatamente o que era enviado em uma consulta real. A discussão saiu do plano das promessas e passou para evidência observável.
Vale exigir isso por escrito, porque a política pública de um provedor pode diferir do plano contratado.
Quem escolhe manter a camada no próprio ambiente assume responsabilidades que valem estar claras desde o começo:
O último item é o mais esquecido e o que mais gera incidente operacional.
O Company Brain da Strattum roda dentro da infraestrutura do cliente justamente por isso: o dado permanece no ambiente e apenas o trecho necessário trafega em cada consulta.
Elimina o tráfego externo e transfere para a empresa a responsabilidade de operar, atualizar e proteger a infraestrutura de inferência. É a escolha certa quando a regulação exige, e não por padrão.
Funciona quando a tarefa não depende da identidade. Em análise que exige nome ou documento, o controle vem da topologia e do contrato.
Vale levantar o que foi enviado na fase de experimentação e verificar a política de retenção do provedor para aquele período.
Com o mapa de fluxo por tipo de consulta, o log de recuperação e uma captura mostrando o conteúdo efetivamente enviado em chamadas reais.
Fale com um especialista da Strattum sobre onde seus dados ficam e o que trafega até o modelo.