主题并非议程:文本嵌入的引用社区审计
信息检索
2026-05-11 v1 计算与语言
机器学习
摘要
向量搜索和检索增强生成 (RAG) 依赖于文本嵌入之间余弦相似性反映概念相关性的假设。我们衡量了这一假设何时失效。我们构建了一个覆盖 358 万篇科学论文的扩充引用图,并通过 Leiden CPM 在两个层次上进行分区:子领域 (L1) 和研究议程 (L2, 每个 L1 内部的层次化)。四个最先进的嵌入方法 (Gemini、Qwen3-8B、Qwen3-0.6B、SPECTER2) 在 L1 层面表现合理(45-52% 的 top-10 同域率),但在 L2 层面效果不佳:仅有 15-21% 的 top-10 邻居共享查询的研究议程。从绝对意义上看,调查出的 80% 论文都不在同一议程下。这种失效在八个科学领域中均普遍存在,且所有四个模型都如此;尽管 SPECTER2 基于引用对比训练,却是最弱的。作为诊断探针,我们测试该扩充图是否也作为检索信号:一个刻意设计的简单引用计数重新排序在 80 个精选议程查询上,能够在 LLM 扩展的布尔检索之上获得 57.7% 的 top-1 L2,以及在纯 BM25 之上获得 59.6%——大约比最好的余弦检索器 (Gemini, 50.6%) 高出 9 个百分点,比 BM25 alone (39.3%) 高出 20 个百分点。该探针隔离了议程匹配信号图携带的片段,但嵌入未能捕获的部分,将最近的单向量检索理论极限与科学 RAG 的具体失效模式相连接。
引用
@article{arxiv.2605.07158,
title = {Topic Is Not Agenda: A Citation-Community Audit of Text Embeddings},
author = {Junseon Yoo},
journal= {arXiv preprint arXiv:2605.07158},
year = {2026}
}
备注
16 pages, 4 figures, 4 tables