中文

Conan-embedding:利用更多和更好的负样本的通用文本嵌入

计算与语言 2024-08-30 v2

摘要

随着 RAG 热潮的不断涌现,嵌入模型的能力正受到日益关注。嵌入模型主要通过对比损失学习,负样本是其关键组成部分。以往工作提出了各种硬负样本挖掘策略,但这些策略通常作为预处理步骤使用。本文提出了 conan-embedding 模型,最大化更多和更高质量负样本的利用。具体而言,由于模型处理预处理负样本的能力会随着训练的演进,我们提出了一种动态硬负样本挖掘方法,以便在整个训练过程中暴露模型于更具挑战性的负样本。其次,对比学习需要尽可能多的负样本,但受限于 GPU 内存限制。因此,我们使用跨 GPU 均衡损失为嵌入训练提供更多负样本并跨多个任务平衡 batch size。此外,我们还发现来自大语言模型的提示-响应对可用于嵌入训练。我们的方法有效提升了嵌入模型的能力,目前在中文大型文本嵌入基准测试中名列前茅。

关键词

引用

@article{arxiv.2408.15710,
  title  = {Conan-embedding: General Text Embedding with More and Better Negative Samples},
  author = {Shiyu Li and Yang Tang and Shizhe Chen and Xi Chen},
  journal= {arXiv preprint arXiv:2408.15710},
  year   = {2024}
}