Estudo de caso · julho de 2026
Um recurso real em processo disciplinar perante uma ordem profissional foi redigido, submetido a ataque adversarial, com as 192 citações conferidas nas fontes e interposto, por uma só pessoa a trabalhar com um sistema agêntico de IA. Todos os números que se seguem vêm de uma auditoria forense aos transcripts completos das sessões: tanto quanto sabemos, a primeira auditoria integral publicada sobre a produção de uma peça jurídica assistida por IA. É este o plano validado do produto que queremos construir.
A redação jurídica com chatbots tem um modo de falha célebre e vários mais discretos. O célebre são as citações inventadas, e está a piorar: a base de dados AI Hallucination Cases, que regista as decisões em que um tribunal deu por provado que uma parte se apoiou em material alucinado, contava cerca de 200 a meio de 2025 e mais de 1 500 a meio de 2026, com as primeiras suspensões do exercício da profissão por peças assistidas por IA já aplicadas. As falhas discretas são as que perdem processos. A exatidão cai muito quando o trabalho exige síntese entre muitos documentos, e nada dá o alerta quando o facto decisivo do processo é lido e deixado passar.
A primeira fase aqui descrita produziu exemplos de todas. Seis versões redigidas com apoio de um chatbot comercial produziram um recurso estruturalmente excelente que continha também 18 defeitos numerados, incluindo uma passagem citada que não existe na fonte, uma decisão de tribunal superior datada de um domingo em férias judiciais e o facto isolado mais importante do processo esquecido numa página digitalizada.
Nada disto é visível apenas a partir do texto. Tudo isto é desqualificante perante um juiz ou um relator. A oportunidade de produto não é «IA que escreve peças jurídicas». É IA capaz de provar que o que escreveu tem fundamento, a um custo acessível para sociedades de advogados de pequena dimensão e departamentos jurídicos.
O processo correu em três regimes distintos. Cada um corresponde a um módulo do produto e cada um foi auditado a partir dos transcripts completos após a interposição:
6 versões de rascunho feitas da forma tradicional, com o apoio de um chatbot comercial (ChatGPT, Perplexity ou equivalente). Produziu a arquitetura argumentativa que sobreviveu até à versão final, e os 18 defeitos já enumerados. O que isto mostra: o pipeline tem de partir daquilo que o advogado já tem, um rascunho completo ou apenas uma linha de argumentação, e nenhum rascunho pode ser o último passo.
≈ 8 horas de trabalho agêntico durante a noite, definido uma única vez numa «carta de missão» reutilizável e conduzido por apenas 16 mensagens humanas curtas: mapeamento do documento → 6 análises especializadas em paralelo → ataque adversarial (dois agentes isolados construíram 45 formas de derrubar o recurso; um agente avaliador pontuou cada uma) → uma matriz de 192 citações cotejada com as fontes primárias descarregadas. A análise central (fases −1 a 4) correu em ≈ 2h10 com exatamente 2 mensagens humanas. 26 agentes em 5 workflows orquestrados nesta fase, de 46 agentes de produção no conjunto do projeto.
O revisor leu o documento e contestou ponto por ponto; a IA confirmou cada objeção nas fontes antes de editar, com garantias transacionais (âncoras únicas, validação de formato, registo datado de alterações). Versões v8→v13, agentes verificadores independentes em cada entregável, assinatura e interposição manuais.
Tudo o que este trabalho produziu reside num dossiê estruturado em ficheiros. É isto que o torna auditável, retomável e, no limite, um produto.
SVD-025-2026/ ├─ 00_INSTRUCOES carta de missão, transições de estado 4 ficheiros · 11k palavras ├─ 01_FONTES o processo, ficheiros só de leitura 62 docs · 211 páginas ├─ 02_LEGISLACAO legislação descarregada e conferida 28 ficheiros · 33k palavras ├─ 03_JURISPRUDENCIA jurisprudência, registos por fonte 19 ficheiros · 25k palavras ├─ 04_ANALISES mapa do caso + análises especializadas 10 ficheiros · 63k palavras ├─ 05_ADVERSARIAL 45 vetores de ataque + veredictos 3 ficheiros · 27k palavras ├─ 06_VERIFICACAO matriz de 192 citações, auditorias 6 ficheiros · 62k palavras ├─ 07_PARECER parecer técnico + correções 3 ficheiros · 19k palavras └─ 08_ENTREGA v7…v13, kit de entrega, registo datado 28 ficheiros · 78k palavras
O processo que entrou são 62 documentos distintos em 211 páginas, entregues em 11 ficheiros só de leitura, e traz ≈ 55 300 palavras que uma máquina consegue extrair: 50 dessas páginas não têm qualquer camada de texto. Todo o resto do dossiê é trabalho produzido: 101 ficheiros e ≈ 317 000 palavras escritas em 3 dias, cerca de 5,7 palavras produzidas por cada palavra do processo. Cada afirmação é rastreável até um ficheiro, cada edição até uma entrada datada no registo.
Depois da interposição, fizemos uma auditoria forense: um script determinístico sobre cada transcript de sessão, dez agentes de análise e um revisor adversarial de exaustividade que corrigiu os erros dos próprios analistas. Quatro conclusões definem o produto:
«Está tudo mesmo terminado? Mesmo os agentes que morreram a meio com erros de API?» — a pergunta do utilizador que expôs uma verificação degradada em silêncio, e a razão pela qual declarar o que foi verificado é uma funcionalidade central do produto
| Item | Valor | Nota |
|---|---|---|
| Output do modelo gerado | 6,13 M tokens | 993 M processados; 95 % são releituras de contexto em cache |
| Computação, equivalente API | 1 459–1 768 USD | toda a fase agêntica, a preços de tabela; exclui verificações cruzadas pontuais em modelos de terceiros |
| Processo, como entrada | 62 docs · 211 pp | ≈ 55 300 palavras extraíveis; 50 páginas sem camada de texto, 22 documentos (35 %) só em imagem |
| Trabalho registado em ficheiro | ≈ 317 000 palavras | 5,7× as palavras do processo: análises, ficheiros de ataque e defesa, matriz de citações, parecer, 8 versões |
| Duração útil das sessões | ≈ 25 h | 11 sessões de ponta a ponta; cerca de 8 h correram sem supervisão durante a noite |
| Tempo humano, ativo | 13–15 h | modelado, não medido: os transcripts registam quando o revisor agiu, nunca quando esteve a ler sem agir |
Três observações sobre preço. Em primeiro lugar, a esta escala o trabalho não tinha preço nenhum. A verificação de 192 citações nas fontes primárias, e 45 vetores de ataque adversarial pontuados um a um, é o que uma defesa bem financiada produz ao longo de semanas; nenhuma sociedade de pequena dimensão ou advogado em prática isolada o compra para um só processo, por valor nenhum. Em segundo lugar, onde existe um equivalente em honorários profissionais, o custo de computação é inferior em, pelo menos, uma ordem de grandeza, e em duas nas jurisdições mais caras, o que coloca este tipo de trabalho ao alcance de sociedades de advogados de pequena dimensão e departamentos jurídicos. O que limita o preço passa a ser o tempo de revisão qualificada, não a computação. Em terceiro lugar, o custo é dominado pela releitura de contexto (leituras e escritas de cache) e não pela geração, ou seja, as arquiteturas de workflow e de cache, que controlamos, são as principais alavancas de custo. Nada aqui foi otimizado para custo: o objetivo era chegar ao fim. Essas alavancas estão por usar, e esperamos fazer o mesmo trabalho com menos de metade da computação nas próximas iterações.
A auditoria sintetizou o processo em nove passos replicáveis: seis foram concebidos à partida, dois emergiram sob pressão e um foi a própria auditoria a encontrá-lo em falta:
Utilizador-alvo: advogados e departamentos jurídicos de empresas sem competências técnicas. O que compram é verificação, auditabilidade e processo: a matriz de citações, o teste adversarial, o rasto datado de auditoria que podem subscrever.
Quatro propriedades da arquitetura são o que torna o resultado repetível e não uma questão de sorte, e são as que tencionamos manter em qualquer reescrita:
Hoje o fan-out segue as questões jurídicas: seis lentes de especialidade em paralelo, dois atacantes, um avaliador. O fan-out por documento também existe, e é a parte que escala linearmente com o volume, mas está no fim do pipeline, a verificar o que já foi produzido. A próxima iteração leva esse mesmo padrão para a entrada: um agente por documento, cada um a devolver um registo estruturado de entidades, datas, atos, referências cruzadas e intervalos de páginas, passando o mapa do caso a resultar de uma consulta a esse índice. A matriz de citações já traz afirmação → transcrição exata → fonte e página nas 192 linhas; acrescentar identificadores de entidade e de evento transforma o raciocínio entre documentos num join e leva a matriz para o início do pipeline, onde passa a alimentar a análise que hoje audita. As partições passam a derivar do índice e a síntese corre em árvore, por questão jurídica primeiro. Nada disto é maquinaria nova. É a maquinaria acima, ligada por outra ordem.
Método. Todos os valores derivam de uma análise determinística dos transcripts completos das sessões (11 sessões, 59 ficheiros de transcript para 46 agentes distintos, ≈ 993 M tokens), confirmada por dez agentes de análise e um revisor adversarial de exaustividade; os números autodeclarados foram corrigidos por confronto com os elementos em disco (por exemplo, «68 agentes, 0 falhas» → 46 agentes de produção, 6 falhas de agente recuperadas). Um valor é modelado e não extraído: o tempo humano ativo. A presença tem de ser imputada a partir dos registos de ação, e duas convenções convergem em 13–15 h, entre um mínimo de 10,6 h e um máximo de 18,1 h. Horas em UTC. O custo de computação é equivalente API a preços de tabela; a utilização real foi por subscrição. As verificações cruzadas pontuais em GPT-5.6 Terra e Gemini 3.1 Pro (origem da segunda opinião avaliada para a v11) não estão incluídas nos valores de tokens nem de custo. O processo é identificado aqui por uma referência interna Satrix; o número do processo e os elementos identificativos são reservados. Todos os valores são do caso real. Relatório interno completo de auditoria e anexos disponíveis mediante pedido.
→ Auditoria de processo: cronologia das sessões, genealogia do documento, orquestração e catálogo de falhas.
A Satrix.ai não é uma sociedade de advogados e não presta aconselhamento jurídico, patrocínio judiciário nem quaisquer outros serviços jurídicos. Este documento reporta trabalho técnico sobre um sistema de IA e não toma posição sobre o mérito da causa em que se baseia.