LongEmbed:扩展嵌入模型以支持长上下文检索
计算与语言
2024-11-08 v3 机器学习
摘要
嵌入模型在现代自然语言处理应用中扮演着关键角色,例如信息检索和检索增强生成。尽管大语言模型的上下文限制已被推至超过100万token,但嵌入模型仍局限于不超过8k token的窄上下文窗口,这限制了其在需要长输入的应用场景(如法律合同)中的使用。本文探索了现有嵌入模型的上下文窗口扩展,无需额外训练即可将限制推至32k。首先,我们在新构建的LongEmbed基准上评估了当前嵌入模型在长上下文检索中的性能。LongEmbed包含两个合成任务和四个精心选择的真实任务,涉及不同长度和分散目标信息的文档。基准测试结果凸显了这些模型存在巨大的改进空间。基于此,全面的实验表明,无需训练的上下文窗口扩展策略(如位置插值)可以有效扩展现有嵌入模型的上下文窗口数倍,无论其原始上下文是512还是超过4k。此外,对于采用绝对位置编码的模型,我们展示了进一步微调以获得显著性能提升的可能性,同时严格保留短输入的原始行为。对于使用旋转位置嵌入的模型,当采用旋转位置嵌入特定方法(如NTK和SelfExtend)时观察到显著增强,表明旋转位置嵌入在上下文窗口扩展方面优于绝对位置编码。为促进未来研究,我们发布了E5-Base-4k和E5-RoPE-Base,以及LongEmbed基准。
引用
@article{arxiv.2404.12096,
title = {LongEmbed: Extending Embedding Models for Long Context Retrieval},
author = {Dawei Zhu and Liang Wang and Nan Yang and Yifan Song and Wenhao Wu and Furu Wei and Sujian Li},
journal= {arXiv preprint arXiv:2404.12096},
year = {2024}
}
备注
EMNLP 2024 Camera Ready