中文

单遍扫描文档用于问答

计算与语言 2025-08-11 v2

摘要

处理大型文档进行问答是具有挑战性的:块状嵌入方法常常丢失重要的全局上下文,而完整上下文变压器对数十万标记的成本则不可接受。我们提出一种单遍扫描文档的方法,该方法以线性时间处理整个文本,同时决定哪些句子与查询最相关。在41个问答基准测试中,我们的单遍扫描器持续优于块状嵌入方法,并以更低的计算成本与大型语言模型竞争。通过在没有块中断的情况下以整个前导上下文为条件,该方法保持了全局一致性,这在处理长文档时尤为重要。总体而言,单遍文档扫描为处理大规模文本的问答提供了一个简单解决方案。所有代码、数据集和模型检查点均可在 https://github.com/MambaRetriever/MambaRetriever 获取。

关键词

引用

@article{arxiv.2504.03101,
  title  = {Single-Pass Document Scanning for Question Answering},
  author = {Weili Cao and Jianyou Wang and Youze Zheng and Longtian Bao and Qirui Zheng and Taylor Berg-Kirkpatrick and Ramamohan Paturi and Leon Bergen},
  journal= {arXiv preprint arXiv:2504.03101},
  year   = {2025}
}

备注

Published at Conference on Language Modeling (COLM), 2025