RAGJur
DADOS PÚBLICOS · MEDIÇÃO DIRETA NO ÍNDICE

Transparência da base

Números reais do corpus RAGJur — medidos por contagens diretas no índice, servidos pelo endpoint público GET /api/v1/qualidade e atualizados nesta página a cada hora. Nenhum percentual aqui é estimado por amostragem ou declarado por marketing.

114.656.179

julgados indexados

531.568

coletados nas últimas 24h

90+

tribunais e fontes oficiais

Medição gerada em 04/10/2026, 20:42 (horário de Brasília) · fonte: GET https://api.ragjur.ai/api/v1/qualidade

Cobertura por campo

O que cada julgado carrega de metadado

Percentual de documentos com o campo presente, contado diretamente sobre a base completa (exists queries no Elasticsearch — sem amostragem).

Relator
98,2%

nome do relator identificado no julgado

Ementa substantiva
98,2%

ementa presente com conteúdo mínimo (word_count ≥ 20)

Data de julgamento
83,4%

data em que o órgão julgou

Data de publicação
62,7%

data de publicação no diário oficial

Inteiro teor
62,1%

documento completo disponível, além da ementa

Embedding E5
99%

vetor multilingual-e5 (1024d) gerado para busca semântica

Fonte
99,9%

origem (base/tribunal) identificada

≥ 95% 80–95%< 80% — em expansão contínua

Sim, publicamos também o que ainda não está pronto: inteiro teor e data de publicação dependem da disponibilidade de cada tribunal de origem — onde a fonte fornece, nós indexamos. A coleta é contínua (531.568 documentos entraram nas últimas 24h) e estes percentuais só sobem.

Classes processuais

Normalização que permite filtrar e agregar entre 90 tribunais

Cada tribunal nomeia suas classes de um jeito. Nós mapeamos tudo para uma taxonomia única — é isso que torna a jurimetria comparável entre cortes.

76,5%

da base com classe normalizada

julgados que já possuem classe_norm na taxonomia única do RAGJur

99,9%

de sucesso na normalização

dos documentos em que a fonte fornece classe processual, esta é a parcela que o crosswalk + extração consegue normalizar

3,7%

classificados como OUTRAS

3,22M documentos em classes de baixa frequência agrupadas no bucket residual — honestidade sobre o que não mapeamos

Top classes normalizadas

—26,97M
APELACAO_CIVEL17,38M
AGRAVO_INSTRUMENTO13,31M
RECURSO_INOMINADO6,42M
RECURSO_ORDINARIO_TRAB6,4M
EXECUCAO_FISCAL4,07M
EMBARGOS_DECLARACAO3,97M
PROCEDIMENTO_COMUM3,53M
OUTRAS3,22M
HABEAS_CORPUS2,6M

Classe processual por tribunal (top 12 por volume)

Onde está o gap: percentual de documentos em que a fonte fornece a classe processual — quando é baixo, a limitação é da origem, não da indexação.

TribunalDocsCom classe
TJSP36,39M64%
TST9,05M99%
TJRS6,82M80%
TJMG6,69M100%
TRF46,01M93%
TJPR5M58%
STJ4,14M89%
TJBA3,88M39%
TRF33,16M96%
TJSC2,83M60%
TJMA2,69M100%
TRT22M92%

Metodologia

Como medimos — e por que você pode confiar

Toda métrica desta página sai do endpoint público GET https://api.ragjur.ai/api/v1/qualidade, que roda contagens e agregações diretamente sobre o índice completo. Você pode chamar o endpoint com a sua chave de API e conferir os mesmos números.

Deduplicação por SHA-1

Cada julgado recebe uma chave de deduplicação derivada de SHA-1 dos seus identificadores canônicos. Duplicatas de coleta são detectadas por essa chave, e a estimativa de duplicados é publicada no endpoint assim que o backfill do campo dedup_key é concluído — não escondemos o número quando ele existe.

Ementa substantiva (≥ 20)

Contar “tem ementa” é fácil e enganoso: muitos documentos trazem ementa vazia ou residual. Só contamos como cobertura as ementas com conteúdo mínimo mensurável (word_count ≥ 20) — texto suficiente para sustentar busca e grounding de LLM.

Embeddings E5 (1024d)

A cobertura de embedding conta documentos com vetor multilingual-e5 de 1024 dimensões efetivamente gerado e indexado — é o que alimenta a busca semântica (kNN) e o modo híbrido com rerank. Percentual verificado documento a documento, não por lote declarado.

Normalização por crosswalk + extração

Classes processuais viram taxonomia única em duas camadas: um crosswalk curado de equivalências entre as nomenclaturas dos tribunais e extração do texto quando a fonte não fornece o campo estruturado. O que não é mapeado com segurança vai para OUTRAS— nunca “chutamos” uma classe para inflar cobertura.

Frescor: o endpoint mantém cache de 1 hora no servidor (as agregações sobre 100M+ documentos são caras) e esta página revalida a cada 1 hora via ISR. Os números que você vê aqui têm, no máximo, algumas horas de defasagem — e a base cresce continuamente.

confira você mesmo
curl "https://api.ragjur.ai/api/v1/qualidade" \
  -H "x-api-key: rj_SUA_CHAVE"

Qualquer chave de API válida retorna exatamente os números exibidos nesta página.

Uma base que mostra os próprios números é uma base em que dá para apostar

Use o corpus completo na sua pesquisa, no seu produto ou no seu agente de IA — com busca híbrida, jurimetria e verificação anti-alucinação por cima.

Trial de 7 dias, sem cartão de crédito · cobertura por tribunal · jurimetria

Métricas desta página: fonte única GET /api/v1/qualidade — sem números de marketing.