中文

让文本嵌入模型成为少样本学习器

信息检索 2024-09-25 v1 计算与语言

摘要

具有解码器-only架构的大型语言模型展现出卓越的上下文学习能力。这一特性使它们能够通过利用输入上下文中提供的示例,有效处理熟悉和新颖的任务。认识到这一潜力的可能性,我们提出利用大型语言模型中的上下文学习特性来增强文本嵌入生成过程。为此,我们引入了一个新颖的模型bge-en-icl,它使用少样本示例来生成高质量的文本嵌入。我们的方法将任务相关示例直接整合到查询端,从而在各种任务上带来了显著的改进。此外,我们还研究了如何有效利用大型语言模型作为嵌入模型,包括各种注意力机制、池化方法等。我们的发现表明,保留原始框架通常能产生最佳结果,这强调了简单即最优。在MTEB和AIR-Bench基准上的实验结果表明,我们的方法取得了新的最先进性能。我们的模型、代码和数据集可在https://github.com/FlagOpen/FlagEmbedding免费获取。

关键词

引用

@article{arxiv.2409.15700,
  title  = {Making Text Embedders Few-Shot Learners},
  author = {Chaofan Li and MingHao Qin and Shitao Xiao and Jianlyu Chen and Kun Luo and Yingxia Shao and Defu Lian and Zheng Liu},
  journal= {arXiv preprint arXiv:2409.15700},
  year   = {2024}
}