RAGJur

Jurimetria

Como cada número é calculado, com que incerteza e quais são os limites declarados.

Princípios

  1. Nenhum número sem incerteza. Toda taxa vem com intervalo de confiança 95% (Wilson) ou com gate de amostra.
  2. Denominador honesto. Só entram decisões classificadas; documento sem dispositivo reconhecível é não-classificado e reportado como cobertura.
  3. Recência declarada. Decisões antigas pesam menos (decaimento exponencial por área) e o n efetivo (Kish) reflete isso.
  4. Reprodutibilidade. Fórmulas fechadas e testes determinísticos (Monte Carlo com seed).

Pipeline

pipeline
~62M julgados (Elasticsearch)
  ├─ escopo: fonte / tribunal / turma / relator / período (+ busca textual)
  ├─ classificação de dispositivo (match_phrase, mutuamente exclusiva)
  │    ├─ 2ª instância: PROVIDO | PARCIAL | NÃO PROVIDO | NÃO CONHECIDO
  │    ├─ 1ª instância: PROCEDENTE | PARCIAL | IMPROCEDENTE | ACORDO | EXTINTO
  │    └─ busca temática (modo mérito): direcional para ~95 temas
  ├─ taxa = favoráveis ÷ classificados   (nunca ÷ total bruto)
  └─ IC 95% = Wilson (ponderado por recência quando há série temporal)

Métricas por endpoint

EndpointMétricaMétodo
/panoramataxa_geral, por turma, relator e anoContagens por categoria de resultado; _meta com n e confiança
/previsaotaxa + intervalo_confiancaWilson 95% (z = 1,96)
/previsao-temporaltaxa_ponderada, n_efetivo, coberturaPeso 2^(−idade/meia-vida); IC Wilson com n efetivo de Kish
/predicaoprobabilidade + fatoresLogito da taxa-base + desvios de turma/relator + tendência, clamp [0,001; 0,999]
/divergenciachi2, p_value, significativoQui-quadrado de independência entre turmas (α = 0,05)
/evolucaoperiodos, media_movelHistograma trimestral; média móvel de 4 trimestres
/mudancamudancas, p_valueCUSUM + Welch t-test entre janelas
/breakpointsbreakpoints, tendencia_atualCUSUM ou bayesiano; variação 12 m (limiar ±2 pp)
/rigorranking, indice_rigorBayes empírico: shrinkage Beta com 20 pseudo-decisões; z-score vs. pares
/radarradar por eixo(taxa_juiz − média)/σ por eixo temático, clamp ±3; gates n ≥ 5/tema, ≥ 10/eixo
/taxa-reformataxa_reforma, comparativo_instanciasAlinhamento só quando ICs 95% se cruzam (n ≥ 30 em ambos)
/argumentos, /dnatermos e scoreslog2 odds ratio favorável/desfavorável; significant_text do Elasticsearch
/tempo-tramitacaomédia, mediana, p10–p95Diferença entre data de julgamento e publicação; agregações por turma/ano

Intervalo de Wilson e n efetivo

fórmulas
center = (p + z²/2n) / (1 + z²/n)
margin = (z / (1 + z²/n)) · √( p(1−p)/n + z²/4n² )        z = 1,96

Série ponderada por recência:
w_i        = exp(−ln2 · idade_i / meia_vida)
p̂          = Σ w_i·favorável_i / Σ w_i
n_efetivo  = (Σ w_i)² / Σ w_i²                            [Kish 1965]

Validação: Monte Carlo com 10.000 tentativas × 7 cenários (p de 0,02 a 0,9; n de 5 a 400) — cobertura empírica 93–96% (nominal 95%).

Meias-vidas por área

Área (area=)Meia-vida
trabalhista3 anos
consumidor4 anos
tributario, administrativo, familia, padrão5 anos
penal6 anos
civil / civel7 anos
constitucional10 anos

Índice de rigor (Bayes empírico)

fórmula
taxa_bayes = (fav + α₀) / (total + 20),   α₀ = 20 · média_tribunal
z = (taxa_bayes_juiz − média_pares) / σ_pares
≤ −2σ muito rigoroso · ≤ −1σ rigoroso · ≥ +1σ leniente · ≥ +2σ muito leniente
gates: < 3 juízes → sem ranking; σ ≈ 0 → todos neutros

Qualidade da amostra (_meta)

n classificadosconfiancaLeitura
≥ 100altaAmostra robusta
30–99mediaAdequada para inferência
10–29baixaInterpretar com cautela
< 10insuficienteNão conclua tendência

Limites declarados

  • A classificação de dispositivo é lexical (frases no dispositivo/ementa); decisões parciais entram no denominador como convenção conservadora.
  • Meias-vidas calibradas na literatura (Black & Spriggs 2013); calibração com dados brasileiros é trabalho futuro.
  • Kish assume pesos não correlacionados ao desfecho; o decaimento é uma escolha normativa de recência.
  • Um acórdão com dispositivos contraditórios entre recursos é contado como um único documento.
  • Cobertura varia por tema/fonte (ex.: ~9% dos docs de “dano moral” no TST têm dispositivo classificável): confira cobertura e _meta.
Estatísticas descrevem decisões passadas. Não constituem aconselhamento jurídico nem garantia de resultado. Referências: Wilson (1927); Kish (1965); Efron & Morris (1975); Black & Spriggs (2013).