docs: add original PDF/OCR count to README

This commit is contained in:
2026-09-13 14:09:49 +02:00
parent e8c264bbe2
commit fea154f9e9
+6 -3
View File
@@ -1,4 +1,4 @@
# Pet16704 — Análise do Processo # Análise da Petição Nº 16704
Uma linha do tempo navegável de tudo que está nos autos da **Pet16704**, no STF — o processo que reúne Uma linha do tempo navegável de tudo que está nos autos da **Pet16704**, no STF — o processo que reúne
a investigação do colapso do Banco Master (Operação Compliance Zero). São **3.437 documentos**, de a investigação do colapso do Banco Master (Operação Compliance Zero). São **3.437 documentos**, de
@@ -24,8 +24,11 @@ cartório).
## De onde vêm os dados ## De onde vêm os dados
Os documentos originais (PDFs digitalizados dos autos) foram convertidos em texto por OCR com o Os **7.694 PDFs originais** dos autos (baixados diretamente do processo, digitalizados) foram
[liteparse](https://github.com/run-llama/liteparse). Os resumos de cada documento e de cada processo convertidos em texto por OCR com o [liteparse](https://github.com/run-llama/liteparse) — 3.437 deles
são os documentos que aparecem na linha do tempo; os demais 4.257 são de outros processos conexos,
cujo conteúdo virou apenas os resumos do botão "Ver resumo do processo". Os resumos de cada documento
e de cada processo
conexo foram escritos por modelos de IA gratuitos rodados via [opencode](https://opencode.ai). O conexo foram escritos por modelos de IA gratuitos rodados via [opencode](https://opencode.ai). O
reconhecimento de pessoas citadas nos textos usou um modelo especializado em português jurídico reconhecimento de pessoas citadas nos textos usou um modelo especializado em português jurídico
(código e detalhes técnicos em `pipeline/`, para quem quiser conferir). (código e detalhes técnicos em `pipeline/`, para quem quiser conferir).