docs: add original PDF/OCR count to README
This commit is contained in:
@@ -1,4 +1,4 @@
|
||||
# Pet16704 — Análise do Processo
|
||||
# Análise da Petição Nº 16704
|
||||
|
||||
Uma linha do tempo navegável de tudo que está nos autos da **Pet16704**, no STF — o processo que reúne
|
||||
a investigação do colapso do Banco Master (Operação Compliance Zero). São **3.437 documentos**, de
|
||||
@@ -24,8 +24,11 @@ cartório).
|
||||
|
||||
## De onde vêm os dados
|
||||
|
||||
Os documentos originais (PDFs digitalizados dos autos) foram convertidos em texto por OCR com o
|
||||
[liteparse](https://github.com/run-llama/liteparse). Os resumos de cada documento e de cada processo
|
||||
Os **7.694 PDFs originais** dos autos (baixados diretamente do processo, digitalizados) foram
|
||||
convertidos em texto por OCR com o [liteparse](https://github.com/run-llama/liteparse) — 3.437 deles
|
||||
são os documentos que aparecem na linha do tempo; os demais 4.257 são de outros processos conexos,
|
||||
cujo conteúdo virou apenas os resumos do botão "Ver resumo do processo". Os resumos de cada documento
|
||||
e de cada processo
|
||||
conexo foram escritos por modelos de IA gratuitos rodados via [opencode](https://opencode.ai). O
|
||||
reconhecimento de pessoas citadas nos textos usou um modelo especializado em português jurídico
|
||||
(código e detalhes técnicos em `pipeline/`, para quem quiser conferir).
|
||||
|
||||
Reference in New Issue
Block a user