基于嵌入的上下文感知重排序器
计算与语言
2026-02-26 v2
摘要
检索增强生成(RAG)系统依赖从语料库中检索相关证据以支持下游生成。将长文档拆分为多个较短段落的常见做法使得检索更加精细和有针对性,但也带来了挑战,例如需要跨段落推理才能解决指代消解、实体消歧和整合来自多个来源的证据等问题。尽管许多 state-of-the-art(SOTA)重排序方法利用了强大的大预训练语言模型,但仍忽视了上述挑战。因此,我们提出了嵌入式上下文感知重排序器(Embedding-Based Context-Aware Reranker, EBCAR),该框架直接在检索到的段落嵌入上运行,通过段落的结构信息和混合注意力机制来增强跨段落理解,既捕获文档间的 high-level 交互,又捕获每个文档内部的 low-level 关系。我们在 ConTEB 数据集上对 EBCAR 与 SOTA 重排序器进行评估,证明其在需要跨段落推理的信息检索任务中有效,并且在准确性和效率方面具有优势。
引用
@article{arxiv.2510.13329,
title = {Embedding-Based Context-Aware Reranker},
author = {Ye Yuan and Mohammad Amin Shabani and Siqi Liu},
journal= {arXiv preprint arXiv:2510.13329},
year = {2026}
}
备注
Accepted by ICLR 2026