O que é. O Tracer Series aplica a mesma garantia matemática do Madhava — cada documento descartado carrega um bound de Cauchy-Schwarz provando que não pode estar no top-K por similaridade vetorial — a quatro domínios regulados: GOV (governo), JUS (jurídico), MED (saúde) e GAP (financeiro). Cada produto compõe o motor winnex-madhava (pip) + o framework de auditoria tracer-gov da Winnex, adicionando apenas a camada de domínio.

Os quatro produtos

Tracer-GOV — Governo

Auditoria e transparência no setor público. LGPD Art. 20, LAI 12.527/2011, TCU, CGU, GDPR, FOIA. Assinatura ICP-Brasil/Ed25519, políticas de retenção, 8 jurisdições.

Tracer-JUS — Jurídico

e-Discovery e pesquisa legal com garantia. Cadeia de custódia WORM, metadados jurídicos (processo, vara, tribunal, partes). Relatório de auditoria anexável a um processo.

Tracer-MED — Saúde

Triagem clínica com garantia. BlueBERT, CID-10, paciente pseudonimizado, HL7 FHIR. LGPD (saúde), GDPR Art. 9, HIPAA.

Tracer-GAP — Financeiro

Identificação de gap em documentos financeiros. SEC EDGAR 10-K loader, metadados (setor, instrumento, CIK, período, risco). SOX, SEC, CVM, LGPD.

Como funciona

Os produtos não reimplementam a prova. Dependem de winnex-madhava (pip) e tracer-gov (o framework de auditoria compartilhado da Winnex), e adicionam apenas a camada de domínio. Isso garante:

Certificado per-documento: o audit é testemunha, não juiz

A alteração mais recente na stack (winnex-madhava 1.9.1) mudou a arquitetura do certificado de auditoria. Antes, o search_audited recomputava os bounds depois da busca — um "juiz que julga após o fato". Em dados de alta dimensão (arXiv, d=1536) isso divergia do motor e produzia falsos positivos no certificado: o benchmark público winnex-madhava-1-9-0-honest mediu 462/973 violações de certificado em d=1536 (GloVe/BIGANN em d≤128 estavam limpos). Um problema real, exposto e não mascarado.

A correção (1.9.1) transformou o audit em testemunha: o search() captura a decisão de poda no momento exato em que o motor a toma (audit_ids, audit_ubs, audit_residuals, audit_threshold), e o search_audited apenas lê esses valores — nunca recomputa um bound. O certificado é byte-a-byte a decisão real do motor.

Leitura honesta do bug 1.9.0. A 1.9.0 introduziu o certificado per-documento com duas falhas: (1) o resíduo da query usava a norma crua em vez de qn_eff (=1.0 para cosine normalizado), divergindo do motor em d alto; (2) o threshold de poda usava o pool de candidatos (heap[0] entre os k1 avaliados), não o threshold global — marcando até docs do top-10 real como "provadamente excluídos". A 1.9.1 corrigiu ambos: threshold global + captura no momento da decisão. Verificado em winnex-madhava-1-9-1-honest: 0 violações de certificado e consistência 100/100 em todos os datasets (GloVe, BIGANN, arXiv d=1536).

Estado atual (1.9.9 + normalize 1.2.1). A stack evoluiu além do witness: o benchmark winnex-madhava-199-five-csv-datasets-normalize-v2 valida o nan_policy=block_pca do winnex-ai-normalize 1.2.1 (proteção contra dataset corrompido com NaN/inf, como o word2vec Kaggle com 94.72% de linhas degeneradas) e o fix de segfault 1.9.9. O AuditCommitment permanece 100/100 em todos os datasets — a trilha auditável do Tracer é a mesma que o benchmark público valida.

Benchmarks (dados reais, reproduzíveis no Kaggle)

Produto Dataset (real) Corpus recall@10 Viol. Bound pairs ms/query
Tracer-GOVAG News (384d)2.0001.00000200.0000.14
Tracer-JUSIndian Supreme Court (512d)2.0001.00000100.0000.23
Tracer-MEDMTSamples (BlueBERT 768d)2.0001.00000100.0000.20
Tracer-GAPSEC 10-K (512d)1871.000009.3500.08
Leitura honesta dos números. Os benchmarks Tracer usam corpus pequenos (187–2.000 documentos) de propósito — escolhidos para transparência e fácil reprodutibilidade nos notebooks Kaggle públicos. Nessa escala, recall@10 = 1.0000 e 0 violações equivalem a uma varredura linear com bounds: demonstram correção e auditabilidade, não velocidade de busca. O motor Winnex Madhava opera em datasets gigantes — como mostra o benchmark em BIGANN-100M (100 milhões de vetores): madhava-v17-bigann-100m-verified. Os testes GOV/JUS/MED/GAP podem ser executados em corpus maiores trocando o dataset nos notebooks públicos.

Limites precisos da garantia

Como o winnex-ai-normalize mitiga a dependência do embedding

O risco acima é real — e é exatamente o que o winnex-ai-normalize (open source, no GitHub winnex-ai) endereça na ingestão. Antes de indexar, ele audita o corpus e expõe a qualidade do embedding:

  • Quality gate — detecta e bloqueia dataset corrompido: NaN/inf, degeneração (variância ~zero), dimensionalidade errada, isotropia (sem manifold), drift vs referência.
  • nan_policy=block_pca — um corpus com NaN/inf nunca roteia para pca_corpus (que amplifica a corrupção); força basis random + k1 alto.
  • Telemetria honesta — expõe nan_fraction e as flags por severidade (pass/warn/fail), para que o operador veja a qualidade do embedding em vez de assumi-la.

A garantia continua sendo sobre o vetor — mas o normalize é a camada explícita que responde "e se o embedding for ruim?". Verificado publicamente no benchmark winnex-madhava-199-five-csv-datasets-normalize-v2: o word2vec Kaggle (94.72% NaN) é diagnosticado e tratado, e o motor reporta o recall real em vez de fabricar 1.0.

Links

Auditabilidade — tudo é público e verificável. Toda a implementação Winnex pertence à Winnex Brasil Soluções Empresariais LTDA (CNPJ 58.364.637/0001-47). Este site (kleniopadilha.com) é o portfólio de pesquisa pública de Klenio Padilha; o produto comercial e a documentação completa estão em winnex.ai, e todo o código está em github.com/winnex-ai. Todos os repositórios da organização são públicos — 17 no total — incluindo o núcleo Tracer unificado (winnex-tracer + winnex-tracer-core: WORM, Ed25519, AuditCommitment), as integrações Liferay (tracer-med-liferay, tracer-gov-liferay), o motor winnex-madhava (C++20), o winnex-ai-normalize (quality gate), e ainda madhava-sec, winnex-audit-cpp, winnex-production-tools, audit-trail-plugins, winnex-enterprise-stack, winnex-maestro, winnex-axiom, winnex-nano, winnex-xfactor, winnex-madhava-maestro e madhava-l2. Código, especificações (Zenodo), benchmarks (Kaggle) e relatórios são todos auditáveis por terceiros — sem componente fechado.
Pré-patente. A novidade defendida é a combinação prova + auditoria + compliance regulada — não a desigualdade de Cauchy-Schwarz em si, que é prior art bem estabelecido (safe screening, VP-trees, cover trees, metric trees).