Links e acesso
O pensamento
Um número suspeito (95% constante) é uma porta de entrada para a verdade. A investigação provou o oposto da suspeita: o motor é mais inteligente do que parecia — ele orquestra prova e heurística, com o post-filter exato garantindo o recall.
Por que importa
Documenta a cultura do honest benchmark aplicada ao próprio motor: a descoberta de que pruning pode ter duas origens distintas (prova e heurística) é essencial para ler qualquer benchmark do Madhava. Suplemento ao WINNEX UB Width (10.5281/zenodo.21939495).
Metodologia
Investigação forense: comparação do pruning reportado vs o bound teórico; exposição das duas fontes de pruning (proof + heuristic); benchmark honesto reproduzível no kernel Kaggle winnex-madhava-1-8-8-honest (instala winnex-madhava 1.8.8 do PyPI, lê datasets públicos GloVe/BIGANN-100M/arXiv OpenAI, mede só o que o motor retorna)
Resultados principais
- arXiv d=1536 random: bound_pruned=0.4%, prefilter=94.6% — o '95%' é o cutoff, não o bound
- arXiv d=1536 pca_corpus: bound_pruned=80.5%, prefilter=15.7%, recall=1.0000
- GloVe d=100 random: bound_pruned=100.0%, recall=1.0000
- BIGANN-100M d=128 random: bound_pruned=100.0%, recall=1.0000
- Build d=1536: 103.9s → 1.9s (LAPACK via set_basis)
- 0 violações em todos os cenários
Por que esta branch importa
Motor winnex-madhava (PyPI 1.8.8, núcleo C++20) com BasisMode::PCA_CORPUS, build_float32 e set_basis.