上下文是寻找黄金段落的黄金钥匙:上下文文档嵌入的评估与训练
信息检索
2025-06-09 v2
摘要
现代文档检索嵌入方法的一个局限性在于,它们通常独立地编码来自同一文档的段落(文本块),往往忽略了文档其余部分中可能极大改善单个文本块表示的关键上下文信息。在本研究中,我们引入了 ConTEB(Context-aware Text Embedding Benchmark,上下文感知文本嵌入基准),这是一个旨在评估检索模型利用文档全局上下文能力的基准。我们的结果表明,最先进的嵌入模型在需要上下文的检索场景中表现不佳。为解决这一局限性,我们提出了 InSeNT(In-sequence Negative Training,序列内负样本训练),一种新颖的对比后训练方法,该方法与迟分块池化相结合,在保持计算效率的同时增强了上下文表示学习。我们的方法在 ConTEB 上显著提升了检索质量,且未牺牲基础模型的性能。我们进一步发现,使用该方法嵌入的文本块对次优分块策略和更大的检索语料库规模具有更强的鲁棒性。我们在 https://github.com/illuin-tech/contextual-embeddings 开源了所有资源。
引用
@article{arxiv.2505.24782,
title = {Context is Gold to find the Gold Passage: Evaluating and Training Contextual Document Embeddings},
author = {Max Conti and Manuel Faysse and Gautier Viaud and Antoine Bosselut and Céline Hudelot and Pierre Colombo},
journal= {arXiv preprint arXiv:2505.24782},
year = {2025}
}
备注
Under Review