Auditoria de processo · julho de 2026

Como se construiu e se verificou um recurso assistido por IA

Do primeiro rascunho em chat até à v13, interposta perante uma ordem profissional a 29 de julho de 2026, dentro de um prazo perentório. Todos os valores foram extraídos de forma determinística dos transcripts completos das sessões e confirmados por dez agentes de análise e um revisor adversarial de exaustividade. Tanto quanto sabemos, esta é a primeira auditoria integral publicada sobre a produção de uma peça jurídica assistida por IA.

Ler o estudo de caso: o problema, as conclusões da auditoria, o custo por caso e o plano do produto.

Processo de entrada
62
documentos · 211 páginas; 35 % dos documentos só existem como imagem digitalizada
Duração
3 dias
da receção do caso à interposição
Versões
v6 → v13
6 084 → 9 289 palavras (+53 %)
Escrita humana
≈ 7 300
palavras escritas, em 96 intervenções
Agentes
46
agentes de produção · 6 workflows · 6 falhas de agente recuperadas
Output do modelo
6,13 M
tokens (993 M processados, 95 % em cache)
Custo de computação
1,46–1,77 k USD
equivalente API; fase agêntica

01Três regimes de trabalho

O processo correu em três regimes com papéis humanos distintos. É essa a estrutura que um produto deve replicar.

R1

Redação em chat

antes da entrada em processo · 6 versões

v1→v6 produzidas apenas pelo utilizador, com redação tradicional e o apoio de um chatbot comercial (ChatGPT, Perplexity ou equivalente). Uma arquitetura argumentativa sólida, que sobreviveu até à versão final, mas com 18 defeitos identificados mais tarde, incluindo uma citação que não existe na fonte.

R2

Pipeline quase autónomo

27 jul. 17:23 → 28 jul. 01:17 UTC · ≈ 8 h

≈ 8 horas de trabalho agêntico durante a noite a partir de 16 mensagens humanas curtas: 5 workflows, 26 agentes, 45 ataques adversariais julgados, uma matriz de 192 citações. A análise central (fases −1 a 4) correu em ≈ 2h10 com apenas 2 mensagens. Humano = operador dos pontos de controlo.

R3

Revisão a dois e interposição

28 jul. 11:48 → 29 jul. 22:19 UTC · ≈ 2 dias

O revisor lê no Word e contesta ponto por ponto; a IA confirma nas fontes antes de aplicar edições transacionais. 82 % de todas as intervenções humanas; v8→v13; assinatura e interposição manuais. Humano = revisor.

02Cronologia das sessões

Duração útil e output do modelo por sessão (UTC). As sessões fec87fe3 e f4937fdb são a mesma conversa, bifurcada por um reinício da aplicação cliente às 18:53:34 de 27 de julho.

SessãoRegimeJanela (UTC)Duração útil Output (tokens)Msgs do utilizadorMarcos
4abaf260R227 jul. 17:23–17:37
14 min
20 k
3Preparação: pastas, regras, carta de missão, v6 docx→md
fec87fe3R227 jul. 17:37–18:47
70 min
229 k
2Fases −1 a 3 (workflows); termina no reinício
f4937fdbR227 jul. 17:37–20:03
145 min
271 k
3Fases 2–4 concluídas; pausa pedida pelo utilizador respeitada
3b3dbaa6R227 jul. 20:03–20:30
27 min
164 k
2Fase 5: parecer técnico + 15 correções, contexto limpo
8cf1c94cR227 jul. 20:33–01:17
284 min
701 k
19v7 Fase 6; interrupção por limites da conta (118 min); conferência visual das páginas
81391354R328 jul. 11:48–13:59
131 min
372 k
10v8 Análise aprofundada do regime de notificações; a constatação decisiva sobre a entrega em mão própria
7ae18c32R328 jul. 14:02–09:43
≈ 219 min
734 k
26v9 Análise frase a frase de decisões digitalizadas; +1 826 palavras
85a08cecR329 jul. 10:27–20:30
≈ 600 min
977 k
45v10v11v12 Maratona de revisão; termina com erros de API 500/529
63def8dbR329 jul. 20:29–…
≈ 135 min
399 k
13v13 Sprint final, 9 agentes verificadores, interposta às 22:19 UTC

Fora do quadro: 4da11111 (resíduo vazio de transição) e ee148592 (a própria sessão de auditoria). Nenhuma compactação de contexto em todo o projeto: o estado esteve sempre em ficheiros.

03Genealogia do documento

Oito versões, nenhuma saltada. Três arcos: correção de citações (v7–v8), reestruturação retórica (v9–v10) e um reforço lógico sobretudo subtrativo, conduzido pelas perguntas do revisor (v11–v13).

v6
≤ 27 jul. · chat
Rascunho final da fase de chat · 6 084 palavras
v7
27 jul. · noite
9 correções obrigatórias do parecer técnico
v8
28 jul. · 13:10
Constatação da entrega em mão própria + correção do ónus da prova
v9
28 jul. · 14:51
Síntese e mapa; +1 826 palavras, o maior salto
v10
29 jul. · manhã
Duas decisões desambiguadas; docx corrompido detetado e refeito
v11
29 jul. · tarde
Ónus da prova, após avaliação de uma segunda opinião
v12
29 jul. · tarde
Norma de interposição corrigida + microedições registadas
v13 ✓
29 jul. · 21:05
11 pontos de ancoragem verificados nas conclusões · assinada e interposta · 9 289 palavras

Regra de controlo de versões que emergiu em produção: nova versão quando o ficheiro está aberto no Word (ficheiro de bloqueio), já se encontra em revisão humana ou a alteração é estrutural. Caso contrário, edições no próprio ficheiro com entrada datada no registo de alterações.

04Interação humana

96 intervenções, distribuição bimodal

No pipeline, o humano opera os pontos de controlo; na revisão, anota o documento ao ritmo de ≈ 1 mensagem a cada 15 min durante 10 horas.

R2 · pipeline
16 · mediana 14,5 palavras
R3 · revisão
79 · 71 % das palavras
Não atribuída
1 · fora dos dois regimes

Efeito de alavanca: 1 palavra escrita ≈ 840 tokens de output do modelo ≈ 43 palavras de trabalho registado em ficheiro. Em todo o projeto, a IA colocou exatamente uma pergunta estruturada. Todas as decisões de produção passaram por prosa livre.

O que o humano fez de facto

O utilizador julga mais do que instrui: 49 % das intervenções são juízo sobre trabalho feito.

Juízo: ceticismo (20), correções factuais, âmbito · 47 Instruções · 18 Autorizações · 12 Outras · 19

«Está tudo mesmo terminado? Mesmo os agentes que morreram a meio com erros de API?» Foi esta a pergunta que forçou uma reverificação exaustiva e, na cadeia que abriu, a descoberta de uma citação inventada a menos de 24 h do prazo.

05Orquestração: declarado vs. verificado

O resumo final produzido pelo próprio sistema declarava números que o inventário em disco corrige. Daí a telemetria honesta de agentes e falhas ser uma funcionalidade central do produto.

MétricaDeclaradoVerificadoNota
Workflows de produção56+ um workflow de verificação de anexos no dia da entrega (9 agentes)
Agentes de workflow263526 a 27 jul. + 9 a 29 jul.
Subagentes avulsos4211apenas de produção
Total de agentes684659 transcripts − 13 duplicados da bifurcação de sessão
Agentes falhados064 num reinício do cliente + 2 por limites da conta; todos recuperados

Modelos: os 35 agentes de workflow correram todos no modelo topo de gama (Claude Fable 5); a sessão principal passou para o Claude Opus 5 nas sessões de revisão de pormenor, no momento exato da contestação cética do utilizador, e voltou ao modelo anterior na reta final da entrega. Houve verificações cruzadas pontuais em modelos de terceiros (GPT-5.6 Terra, Gemini 3.1 Pro), origem da «segunda opinião» avaliada para a v11; esses tokens estão fora de todas as contagens desta página.

06Tokens e custo de computação

Output por modelo

6,13 M tokens de output; 993 M processados no total, dos quais 95 % são leituras de cache (contexto relido).

Fable 5
3,41 M
Opus 5
2,72 M

O Fable conduziu o pipeline e todos os agentes; o Opus conduziu as sessões de revisão de pormenor. O custo é dominado pela releitura de contexto, não pela geração. As arquiteturas de workflow e de cache são as principais alavancas de custo, e controlamos ambas. O pipeline não está preso a estes modelos: o nível mais caro serve onde é preciso juízo e a verificação passa para modelos mais baratos à medida que a diferença se esbate.

Custo equivalente API (USD)

Preços de tabela; o intervalo corresponde ao preço de escrita em cache com TTL de 5 min vs. 1 h. A utilização real foi por subscrição.

Fable 5
1 076–1 351
Opus 5
383–417
Total
1 459–1 768

Exclui a fase de chat (não auditada) e as verificações cruzadas pontuais em modelos de terceiros (GPT-5.6 Terra, Gemini 3.1 Pro). Pelo menos uma ordem de grandeza abaixo do equivalente em honorários profissionais para o mesmo trabalho verificado, e duas nas jurisdições mais caras.

07Falhas e recuperações

O padrão transversal: as recuperações automáticas funcionaram; as deteções críticas vieram do ceticismo humano ou de agentes verificadores independentes, nunca de quem produziu o trabalho a conferir-se a si próprio. Doze incidentes ao todo: dois deles, o reinício do cliente e os limites da conta, correspondem às 6 falhas de agente contabilizadas acima.

FalhaGravidadeDetetada porDesfecho
Citação inventada no documento desde a fase de chat● críticaAgente de visão, após contestação do utilizadorCorrigida a menos de 24 h do prazo
Verificação por amostragem apresentada como completa● críticaPergunta cética do utilizadorVarrimento exaustivo relançado e particionado
Ficheiro Word corrompido por uma edição ao nível do XML● sériaUtilizador, ao abrir o ficheiroRefeito; salvaguardas permanentes de validação de formato
«Impossível ler PDF digitalizado»: capacidade negada por engano● sériaContestação do utilizadorPipeline de visão construído; documentos só em imagem transcritos
Limites da conta terminam 2 auditores; 118 min de paragem● sériaMensagens de limite nos registos dos agentesRetoma manual; trabalho refeito
Erros factuais herdados do documento● sériaRevisão a dois + confirmação nas fontesCorrigidos com registo datado de alterações
Erro factual no e-mail de entrega, escrito pelo orquestrador● sériaAgente verificador independenteCorrigido antes do envio
Reinício do cliente mata 4 agentes e bifurca a sessão● médiaRegisto do workflowRelançamento automático em ≈ 20 s
A sessão mais longa termina com erros de API 500/529● médiaImediataSessão nova; estado reconstruído a partir dos ficheiros
A SPA do diário oficial inutiliza a ferramenta de leitura de páginas web● médiaImediataExtração em navegador real tornou-se o método padrão
Regressões de formatação introduzidas pelas edições da própria IA● médiaAuditorias ao nível do .docxDiferenças de formatação conferidas run a run no .docx
Race condition no workflow de verificação de anexos● médiaVerificador (falha espúria)Congelar artefactos sob verificação

Método e âmbito. Camada quantitativa: um script determinístico sobre os transcripts completos das sessões (11 sessões, 59 ficheiros de transcript de agentes, 46 agentes distintos depois de removidos os duplicados da bifurcação). Nenhum número passou por um modelo. Camada qualitativa: dez agentes de análise e um revisor adversarial de exaustividade; os valores autodeclarados foram corrigidos por confronto com os elementos existentes em disco. Quatro ressalvas quanto ao âmbito: a fase de chat não foi auditada e foi reconstituída de forma indireta; o papel do advogado assistente não está registado; o custo indicado é equivalente API (a utilização real foi por subscrição); a fricção dos pedidos de aprovação não foi medida. Horas em UTC (local = UTC+1). O processo é identificado aqui por uma referência interna Satrix; o número do processo e os elementos identificativos são reservados. Todos os valores são do caso real.

Estudo de caso: conclusões, custo por caso e plano do produto · Relatório interno completo de auditoria e anexos disponíveis mediante pedido.

A Satrix.ai não é uma sociedade de advogados e não presta aconselhamento jurídico, patrocínio judiciário nem quaisquer outros serviços jurídicos. Este documento reporta trabalho técnico sobre um sistema de IA e não toma posição sobre o mérito da causa em que se baseia.