SitEmb-v1.5:面向语义关联与长篇故事理解的改进上下文感知密集检索
计算与语言
2026-04-22 v2
摘要
检索增强生成(RAG)中的文档长文本检索通常涉及将文本分割成更小的块作为检索的基本单元。然而,由于原始文档中的依赖关系,上下文信息对于准确解释每个块至关重要。为此,先前的工作探索了对更长的上下文窗口进行编码,以生成更长块的嵌入。尽管如此,检索和下游任务的提升仍有限。这是因为(1)更长的块会strain嵌入模型的容量,因为它们必须编码更多信息,而(2)许多实际应用仍需要返回局部证据,因为模型或人类带宽受限。我们提出了一种替代方法,通过对短块进行表征,使其依赖于更广的上下文窗口来增强检索性能,即在其上下文中定位块的含义。我们进一步表明,现有的嵌入模型不擅长有效地编码此类 situ 上下文,因此我们引入了新的训练范式并开发了situated embedding 模型(SitEmb)。为评估我们的方法,我们专门构建了一个书情检索数据集,以评估situated 检索能力。本 benchmark 上,我们基于 BGE-M3 的 SitEmb-v1 模型在检索和下游任务上显著优于最先进的嵌入模型,包括参数量达 7-8B 的多个模型,仅需 1B 参数。我们的 8B SitEmb-v1.5 模型进一步提升了超过 10% 的性能,并在不同语言和多个下游应用中表现出色。
引用
@article{arxiv.2508.01959,
title = {SitEmb-v1.5: Improved Context-Aware Dense Retrieval for Semantic Association and Long Story Comprehension},
author = {Junjie Wu and Jiangnan Li and Yuqing Li and Lemao Liu and Liyan Xu and Jiwei Li and Dit-Yan Yeung and Jie Zhou and Mo Yu},
journal= {arXiv preprint arXiv:2508.01959},
year = {2026}
}
备注
ACL 2025 Main Conference. Our trained models can be downloaded from: https://huggingface.co/SituatedEmbedding