# Pet16704 — Análise do Processo Visualização interativa da linha do tempo dos autos vinculados **Pet16704** (STF) — um ponto por documento, agrupado pela instituição de origem (Relatoria, PGR, Polícia Federal, Partes e Defesas, Secretaria e Cartório) e posicionado pela data real de juntada. **Ver a página publicada:** (preencha aqui o link do GitHub Pages depois do primeiro deploy) ## Como os dados foram montados 1. **`docs.json`** — cruzamento de duas fontes do dump original (uma com a instituição de cada documento, outra com data/texto completo/arquivo-fonte). Ver `pipeline/extract.py`. 2. **Tipo de documento** — extraído do nome do arquivo-fonte de cada documento (ex.: "Despacho", "Petição", "Procuração", "Certidão"), normalizado com acentuação correta. 3. **Pessoas mencionadas (`people.json` / `PESSOAS.md`)** — reconhecimento de entidades feito **localmente, sem usar o Claude para o texto em si**, com o modelo [`pierreguillou/ner-bert-base-cased-pt-lenerbr`](https://huggingface.co/pierreguillou/ner-bert-base-cased-pt-lenerbr) (BERT treinado no corpus **LeNER-Br**, de textos jurídicos brasileiros). Rodado sobre os 3.437 textos via `pipeline/run_ner.py`. Depois da extração bruta (435 nomes distintos), foi feita uma limpeza: - separação de nomes que o modelo juntou erroneamente com "e" (ex. "Fulano e Beltrano" → duas pessoas), preservando sobrenomes compostos legítimos ("Castro e Silva"); - remoção de nomes de escritórios de advocacia reconhecidos como pessoa por engano; - descarte de fragmentos de um único token (nomes incompletos, ex. só o primeiro nome); - junção de variações do mesmo nome por contenção de tokens (ex. "Daniel Vorcaro" → "Daniel Bueno Vorcaro"). Resultado: **292 pessoas distintas**, listadas em `people.json` (formato bruto, usado pela página) e em `PESSOAS.md` (tabelas legíveis, agrupadas por papel). O papel processual de cada pessoa (Relator/Ministro, Outorgante/Parte, Peticionante, Advogado(a), Investigado(a), Delegado(a) PF, Senador(a), Deputado(a), Alvo de diligência, Perito(a), Testemunha) foi inferido por frases-gatilho perto de cada menção (ex. "Despacho do Relator X", "Procuração de X constituindo Y", "em desfavor de X"). **63% das pessoas (185 de 292) ficaram sem papel classificado** ("Mencionado(a)") por falta de um sinal textual próximo confiável — isso é esperado e fica visível na própria listagem, não escondido. **Limitações conhecidas:** isso é reconhecimento automático de entidades em texto livre, não uma base curada. Pode haver nomes não reconhecidos, variações da mesma pessoa não unificadas, e classificações de papel aproximadas. Trate como um ponto de partida para busca, não como fonte definitiva de identidade ou qualificação processual. 4. **Recuperação de datas (`pipeline/recover_dates.py`)** — dos 615 documentos sem data de juntada identificada no dump original, 366 tiveram uma data recuperada lendo o texto original do próprio documento em busca da sua linha de fechamento no padrão "Cidade/UF, DD de mês de YYYY." (ex. "Brasília, 10 de abril de 2026."). Esses casos ficam marcados com `dateInferred: true` em `docs.json` e aparecem no resumo do documento como "data lida no texto do documento, não da juntada nos autos" — é uma data real do documento, mas não necessariamente a data em que foi juntado ao processo. Os 249 restantes seguem sem data (fora do gráfico, só na tabela). Duas versões mais permissivas foram tentadas e descartadas por amostragem manual antes desta: buscar qualquer "DD de mês de YYYY" no texto pegava datas de citação de leis/decretos ("da Lei 11.419, de 19 de dezembro de 2006") e prazos de normas citadas ("será exigido a partir de 1º de janeiro de 2017") como se fossem a data do documento; e um fallback numérico (`dd.mm.aaaa`) pegava números soltos de anexos técnicos longos (um laudo de vistoria, a validade de um CRECI) sem relação com a data real. Exigir uma cidade e vírgula imediatamente antes da data eliminou os falsos positivos encontrados. 5. **Autos vinculados (`resumos/parte1/`, `resumos/parte2/`)** — resumos em markdown dos processos conexos citados ao longo da Pet16704 (Inq 5026, Inq 5035, Inq 5050, Inq 5070, Rcl 88121 e diversas Petições — PET 15198, 15375, 15478 etc.), um arquivo por processo mais um `INDEX.md` consolidado em cada pasta. Cobrem partes/investigados, advogados, autoridades e linha do tempo resumida de cada procedimento. Na página, o resumo de qualquer documento da linha do tempo tem um botão "Ver resumo do processo" que busca e mostra o arquivo correspondente aqui. ## Projeto relacionado [**vorcaros**](https://rafapolo.github.io/vorcaros/) — visualização em grafo da rede societária (empresas e sócios) ligada às mesmas pessoas que aparecem nesta linha do tempo processual. Os dois projetos olham o mesmo caso por ângulos diferentes: um pela rede de negócios, este pelo andamento processual. ## Aviso Este projeto reúne informações de um processo público em curso no STF. Nomes, datas e descrições refletem o conteúdo dos autos tal como disponibilizado; erros de extração automática (OCR, NER, digitação no material de origem) podem existir. Não constitui manifestação jurídica sobre culpa, inocência ou qualquer qualificação processual das pessoas mencionadas.