Transparência da base
Números reais do corpus RAGJur — medidos por contagens diretas no índice, servidos pelo endpoint público GET /api/v1/qualidade e atualizados nesta página a cada hora. Nenhum percentual aqui é estimado por amostragem ou declarado por marketing.
114.656.179
julgados indexados
531.568
coletados nas últimas 24h
90+
tribunais e fontes oficiais
Medição gerada em 04/10/2026, 20:42 (horário de Brasília) · fonte: GET https://api.ragjur.ai/api/v1/qualidade
Cobertura por campo
O que cada julgado carrega de metadado
Percentual de documentos com o campo presente, contado diretamente sobre a base completa (exists queries no Elasticsearch — sem amostragem).
nome do relator identificado no julgado
ementa presente com conteúdo mínimo (word_count ≥ 20)
data em que o órgão julgou
data de publicação no diário oficial
documento completo disponível, além da ementa
vetor multilingual-e5 (1024d) gerado para busca semântica
origem (base/tribunal) identificada
Sim, publicamos também o que ainda não está pronto: inteiro teor e data de publicação dependem da disponibilidade de cada tribunal de origem — onde a fonte fornece, nós indexamos. A coleta é contínua (531.568 documentos entraram nas últimas 24h) e estes percentuais só sobem.
Classes processuais
Normalização que permite filtrar e agregar entre 90 tribunais
Cada tribunal nomeia suas classes de um jeito. Nós mapeamos tudo para uma taxonomia única — é isso que torna a jurimetria comparável entre cortes.
76,5%
da base com classe normalizada
julgados que já possuem classe_norm na taxonomia única do RAGJur
99,9%
de sucesso na normalização
dos documentos em que a fonte fornece classe processual, esta é a parcela que o crosswalk + extração consegue normalizar
3,7%
classificados como OUTRAS
3,22M documentos em classes de baixa frequência agrupadas no bucket residual — honestidade sobre o que não mapeamos
Top classes normalizadas
Classe processual por tribunal (top 12 por volume)
Onde está o gap: percentual de documentos em que a fonte fornece a classe processual — quando é baixo, a limitação é da origem, não da indexação.
| Tribunal | Docs | Com classe |
|---|---|---|
| TJSP | 36,39M | 64% |
| TST | 9,05M | 99% |
| TJRS | 6,82M | 80% |
| TJMG | 6,69M | 100% |
| TRF4 | 6,01M | 93% |
| TJPR | 5M | 58% |
| STJ | 4,14M | 89% |
| TJBA | 3,88M | 39% |
| TRF3 | 3,16M | 96% |
| TJSC | 2,83M | 60% |
| TJMA | 2,69M | 100% |
| TRT2 | 2M | 92% |
Metodologia
Como medimos — e por que você pode confiar
Toda métrica desta página sai do endpoint público GET https://api.ragjur.ai/api/v1/qualidade, que roda contagens e agregações diretamente sobre o índice completo. Você pode chamar o endpoint com a sua chave de API e conferir os mesmos números.
Deduplicação por SHA-1
Cada julgado recebe uma chave de deduplicação derivada de SHA-1 dos seus identificadores canônicos. Duplicatas de coleta são detectadas por essa chave, e a estimativa de duplicados é publicada no endpoint assim que o backfill do campo dedup_key é concluído — não escondemos o número quando ele existe.
Ementa substantiva (≥ 20)
Contar “tem ementa” é fácil e enganoso: muitos documentos trazem ementa vazia ou residual. Só contamos como cobertura as ementas com conteúdo mínimo mensurável (word_count ≥ 20) — texto suficiente para sustentar busca e grounding de LLM.
Embeddings E5 (1024d)
A cobertura de embedding conta documentos com vetor multilingual-e5 de 1024 dimensões efetivamente gerado e indexado — é o que alimenta a busca semântica (kNN) e o modo híbrido com rerank. Percentual verificado documento a documento, não por lote declarado.
Normalização por crosswalk + extração
Classes processuais viram taxonomia única em duas camadas: um crosswalk curado de equivalências entre as nomenclaturas dos tribunais e extração do texto quando a fonte não fornece o campo estruturado. O que não é mapeado com segurança vai para OUTRAS— nunca “chutamos” uma classe para inflar cobertura.
Frescor: o endpoint mantém cache de 1 hora no servidor (as agregações sobre 100M+ documentos são caras) e esta página revalida a cada 1 hora via ISR. Os números que você vê aqui têm, no máximo, algumas horas de defasagem — e a base cresce continuamente.
curl "https://api.ragjur.ai/api/v1/qualidade" \ -H "x-api-key: rj_SUA_CHAVE"
Qualquer chave de API válida retorna exatamente os números exibidos nesta página.
Uma base que mostra os próprios números é uma base em que dá para apostar
Use o corpus completo na sua pesquisa, no seu produto ou no seu agente de IA — com busca híbrida, jurimetria e verificação anti-alucinação por cima.
Trial de 7 dias, sem cartão de crédito · cobertura por tribunal · jurimetria
GET /api/v1/qualidade — sem números de marketing.