中文

否定不是语义问题:诊断医学生物学 QA 中矛盾感知的稠密检索失败模式及其权衡

信息检索 2026-03-19 v1

摘要

大型语言模型(LLMs)在医学生物学问答方面展现出强大的能力,但其倾向于生成不经验证的 plausible 论断在临床环境中构成严重风险。为缓解此风险,TREC 2025 BioGen track 要求提供显式呈现矛盾证据的扎实答案(任务 A)以及基于叙事驱动的、完全归因响应的生成(任务 B)。针对缺乏目标基准_truth 的问题,本文提出一种基于 SciFact 数据集的代理开发框架,用于系统性地优化检索架构。我们的迭代评估揭示了“简单性悖论”:复杂的对抗性稠密检索策略在矛盾检测上 catastrophic 失败(MRR 为 0.023),其原因是语义坍塌(Semantic Collapse),即否定信号在向量空间中变得不可区分。我们进一步识别出一种检索不对称性:过滤稠密嵌入有助于矛盾检测,但会损害支持召回,从而损害可靠性。我们通过建立在统一 BM25 主干之上的解耦词典架构来解决此问题,在平衡语义支持召回率(0.810)与精确矛盾呈现(0.750)之间取得平衡。该方法在代理基准上实现最高的加权 MRR(0.790),同时仍是面向 3000 万文档 PubMed 语料库进行规模化部署的唯一可行策略。对于答案生成,我们引入了叙事感知重排序和零样本情境学习,使引用覆盖率从 50%(零样本)提升至 100%。官方 TREC 结果确认了我们的发现:我们的系统在任务 A 的矛盾 F1 排名第 2,在任务 B 的引用覆盖率(98.77%)中排名第 3(共 50 队),实现了零引用矛盾率。我们的工作将 LLMs 从随机生成器转变为诚实的证据综合器,表明医学生物学 AI 中的认知完整性需要隔离的度量优化与架构可扩展性之间的精确性。

关键词

引用

@article{arxiv.2603.17580,
  title  = {Negation is Not Semantic: Diagnosing Dense Retrieval Failure Modes for Trade-offs in Contradiction-Aware Biomedical QA},
  author = {Soumya Ranjan Sahoo and Gagan N. and Sanand Sasidharan and Divya Bharti},
  journal= {arXiv preprint arXiv:2603.17580},
  year   = {2026}
}