超越几何诅咒:用于稠密检索的高维N-Gram哈希
信息检索
2026-01-22 v1
摘要
为什么即使是最强大的70亿参数嵌入模型,在处理那些已有数十年历史的BM25能轻松应对的简单检索任务时,也会遇到困难?最近的理论表明,这是由于维度瓶颈造成的。当我们试图将无限的语言细微差别强行塞入小的、固定长度的学习向量时,就会出现这种情况。我们开发了NUMEN,通过完全移除学习过程来打破这一瓶颈。NUMEN不训练繁重的层将文本映射到受限空间,而是使用确定性字符哈希将语言直接投影到高维向量上。这种方法无需训练,支持无限词汇量,并允许几何容量按需扩展。在LIMIT基准测试中,NUMEN在32,768维下达到了93.90%的Recall@100。这使其成为首个正式超越稀疏BM25基线(93.6%)的稠密检索模型。我们的发现表明,稠密检索的真正问题不在于架构,而在于嵌入层本身。解决方案不一定是更智能的训练,而仅仅是提供更多的“呼吸空间”。
引用
@article{arxiv.2601.15205,
title = {Beyond the Geometric Curse: High-Dimensional N-Gram Hashing for Dense Retrieval},
author = {Sangeet Sharma},
journal= {arXiv preprint arXiv:2601.15205},
year = {2026}
}
备注
11 page long, 5 figure. Yes, am undergrad in pharmacy and love computer work