Auditoria de processo · julho de 2026
Do primeiro rascunho em chat até à v13, interposta perante uma ordem profissional a 29 de julho de 2026, dentro de um prazo perentório. Todos os valores foram extraídos de forma determinística dos transcripts completos das sessões e confirmados por dez agentes de análise e um revisor adversarial de exaustividade. Tanto quanto sabemos, esta é a primeira auditoria integral publicada sobre a produção de uma peça jurídica assistida por IA.
→ Ler o estudo de caso: o problema, as conclusões da auditoria, o custo por caso e o plano do produto.
O processo correu em três regimes com papéis humanos distintos. É essa a estrutura que um produto deve replicar.
v1→v6 produzidas apenas pelo utilizador, com redação tradicional e o apoio de um chatbot comercial (ChatGPT, Perplexity ou equivalente). Uma arquitetura argumentativa sólida, que sobreviveu até à versão final, mas com 18 defeitos identificados mais tarde, incluindo uma citação que não existe na fonte.
≈ 8 horas de trabalho agêntico durante a noite a partir de 16 mensagens humanas curtas: 5 workflows, 26 agentes, 45 ataques adversariais julgados, uma matriz de 192 citações. A análise central (fases −1 a 4) correu em ≈ 2h10 com apenas 2 mensagens. Humano = operador dos pontos de controlo.
O revisor lê no Word e contesta ponto por ponto; a IA confirma nas fontes antes de aplicar edições transacionais. 82 % de todas as intervenções humanas; v8→v13; assinatura e interposição manuais. Humano = revisor.
Duração útil e output do modelo por sessão (UTC). As sessões fec87fe3 e f4937fdb são a mesma conversa, bifurcada por um reinício da aplicação cliente às 18:53:34 de 27 de julho.
| Sessão | Regime | Janela (UTC) | Duração útil | Output (tokens) | Msgs do utilizador | Marcos |
|---|---|---|---|---|---|---|
| 4abaf260 | R2 | 27 jul. 17:23–17:37 | 3 | Preparação: pastas, regras, carta de missão, v6 docx→md | ||
| fec87fe3 | R2 | 27 jul. 17:37–18:47 | 2 | Fases −1 a 3 (workflows); termina no reinício | ||
| f4937fdb | R2 | 27 jul. 17:37–20:03 | 3 | Fases 2–4 concluídas; pausa pedida pelo utilizador respeitada | ||
| 3b3dbaa6 | R2 | 27 jul. 20:03–20:30 | 2 | Fase 5: parecer técnico + 15 correções, contexto limpo | ||
| 8cf1c94c | R2 | 27 jul. 20:33–01:17 | 19 | v7 Fase 6; interrupção por limites da conta (118 min); conferência visual das páginas | ||
| 81391354 | R3 | 28 jul. 11:48–13:59 | 10 | v8 Análise aprofundada do regime de notificações; a constatação decisiva sobre a entrega em mão própria | ||
| 7ae18c32 | R3 | 28 jul. 14:02–09:43 | 26 | v9 Análise frase a frase de decisões digitalizadas; +1 826 palavras | ||
| 85a08cec | R3 | 29 jul. 10:27–20:30 | 45 | v10v11v12 Maratona de revisão; termina com erros de API 500/529 | ||
| 63def8db | R3 | 29 jul. 20:29–… | 13 | v13 Sprint final, 9 agentes verificadores, interposta às 22:19 UTC |
Fora do quadro: 4da11111 (resíduo vazio de transição) e ee148592 (a própria sessão de auditoria). Nenhuma compactação de contexto em todo o projeto: o estado esteve sempre em ficheiros.
Oito versões, nenhuma saltada. Três arcos: correção de citações (v7–v8), reestruturação retórica (v9–v10) e um reforço lógico sobretudo subtrativo, conduzido pelas perguntas do revisor (v11–v13).
Regra de controlo de versões que emergiu em produção: nova versão quando o ficheiro está aberto no Word (ficheiro de bloqueio), já se encontra em revisão humana ou a alteração é estrutural. Caso contrário, edições no próprio ficheiro com entrada datada no registo de alterações.
No pipeline, o humano opera os pontos de controlo; na revisão, anota o documento ao ritmo de ≈ 1 mensagem a cada 15 min durante 10 horas.
Efeito de alavanca: 1 palavra escrita ≈ 840 tokens de output do modelo ≈ 43 palavras de trabalho registado em ficheiro. Em todo o projeto, a IA colocou exatamente uma pergunta estruturada. Todas as decisões de produção passaram por prosa livre.
O utilizador julga mais do que instrui: 49 % das intervenções são juízo sobre trabalho feito.
«Está tudo mesmo terminado? Mesmo os agentes que morreram a meio com erros de API?» Foi esta a pergunta que forçou uma reverificação exaustiva e, na cadeia que abriu, a descoberta de uma citação inventada a menos de 24 h do prazo.
O resumo final produzido pelo próprio sistema declarava números que o inventário em disco corrige. Daí a telemetria honesta de agentes e falhas ser uma funcionalidade central do produto.
| Métrica | Declarado | Verificado | Nota |
|---|---|---|---|
| Workflows de produção | 5 | 6 | + um workflow de verificação de anexos no dia da entrega (9 agentes) |
| Agentes de workflow | 26 | 35 | 26 a 27 jul. + 9 a 29 jul. |
| Subagentes avulsos | 42 | 11 | apenas de produção |
| Total de agentes | 68 | 46 | 59 transcripts − 13 duplicados da bifurcação de sessão |
| Agentes falhados | 0 | 6 | 4 num reinício do cliente + 2 por limites da conta; todos recuperados |
Modelos: os 35 agentes de workflow correram todos no modelo topo de gama (Claude Fable 5); a sessão principal passou para o Claude Opus 5 nas sessões de revisão de pormenor, no momento exato da contestação cética do utilizador, e voltou ao modelo anterior na reta final da entrega. Houve verificações cruzadas pontuais em modelos de terceiros (GPT-5.6 Terra, Gemini 3.1 Pro), origem da «segunda opinião» avaliada para a v11; esses tokens estão fora de todas as contagens desta página.
6,13 M tokens de output; 993 M processados no total, dos quais 95 % são leituras de cache (contexto relido).
O Fable conduziu o pipeline e todos os agentes; o Opus conduziu as sessões de revisão de pormenor. O custo é dominado pela releitura de contexto, não pela geração. As arquiteturas de workflow e de cache são as principais alavancas de custo, e controlamos ambas. O pipeline não está preso a estes modelos: o nível mais caro serve onde é preciso juízo e a verificação passa para modelos mais baratos à medida que a diferença se esbate.
Preços de tabela; o intervalo corresponde ao preço de escrita em cache com TTL de 5 min vs. 1 h. A utilização real foi por subscrição.
Exclui a fase de chat (não auditada) e as verificações cruzadas pontuais em modelos de terceiros (GPT-5.6 Terra, Gemini 3.1 Pro). Pelo menos uma ordem de grandeza abaixo do equivalente em honorários profissionais para o mesmo trabalho verificado, e duas nas jurisdições mais caras.
O padrão transversal: as recuperações automáticas funcionaram; as deteções críticas vieram do ceticismo humano ou de agentes verificadores independentes, nunca de quem produziu o trabalho a conferir-se a si próprio. Doze incidentes ao todo: dois deles, o reinício do cliente e os limites da conta, correspondem às 6 falhas de agente contabilizadas acima.
| Falha | Gravidade | Detetada por | Desfecho |
|---|---|---|---|
| Citação inventada no documento desde a fase de chat | ● crítica | Agente de visão, após contestação do utilizador | Corrigida a menos de 24 h do prazo |
| Verificação por amostragem apresentada como completa | ● crítica | Pergunta cética do utilizador | Varrimento exaustivo relançado e particionado |
| Ficheiro Word corrompido por uma edição ao nível do XML | ● séria | Utilizador, ao abrir o ficheiro | Refeito; salvaguardas permanentes de validação de formato |
| «Impossível ler PDF digitalizado»: capacidade negada por engano | ● séria | Contestação do utilizador | Pipeline de visão construído; documentos só em imagem transcritos |
| Limites da conta terminam 2 auditores; 118 min de paragem | ● séria | Mensagens de limite nos registos dos agentes | Retoma manual; trabalho refeito |
| Erros factuais herdados do documento | ● séria | Revisão a dois + confirmação nas fontes | Corrigidos com registo datado de alterações |
| Erro factual no e-mail de entrega, escrito pelo orquestrador | ● séria | Agente verificador independente | Corrigido antes do envio |
| Reinício do cliente mata 4 agentes e bifurca a sessão | ● média | Registo do workflow | Relançamento automático em ≈ 20 s |
| A sessão mais longa termina com erros de API 500/529 | ● média | Imediata | Sessão nova; estado reconstruído a partir dos ficheiros |
| A SPA do diário oficial inutiliza a ferramenta de leitura de páginas web | ● média | Imediata | Extração em navegador real tornou-se o método padrão |
| Regressões de formatação introduzidas pelas edições da própria IA | ● média | Auditorias ao nível do .docx | Diferenças de formatação conferidas run a run no .docx |
| Race condition no workflow de verificação de anexos | ● média | Verificador (falha espúria) | Congelar artefactos sob verificação |
Método e âmbito. Camada quantitativa: um script determinístico sobre os transcripts completos das sessões (11 sessões, 59 ficheiros de transcript de agentes, 46 agentes distintos depois de removidos os duplicados da bifurcação). Nenhum número passou por um modelo. Camada qualitativa: dez agentes de análise e um revisor adversarial de exaustividade; os valores autodeclarados foram corrigidos por confronto com os elementos existentes em disco. Quatro ressalvas quanto ao âmbito: a fase de chat não foi auditada e foi reconstituída de forma indireta; o papel do advogado assistente não está registado; o custo indicado é equivalente API (a utilização real foi por subscrição); a fricção dos pedidos de aprovação não foi medida. Horas em UTC (local = UTC+1). O processo é identificado aqui por uma referência interna Satrix; o número do processo e os elementos identificativos são reservados. Todos os valores são do caso real.
→ Estudo de caso: conclusões, custo por caso e plano do produto · Relatório interno completo de auditoria e anexos disponíveis mediante pedido.
A Satrix.ai não é uma sociedade de advogados e não presta aconselhamento jurídico, patrocínio judiciário nem quaisquer outros serviços jurídicos. Este documento reporta trabalho técnico sobre um sistema de IA e não toma posição sobre o mérito da causa em que se baseia.