中文

Conan-Embedding-v2:从零开始训练用于文本嵌入的大语言模型

计算与语言 2025-09-17 v1 人工智能

摘要

大语言模型(LLM)近期在文本嵌入任务中展现出卓越的性能。以往的工作通常使用LoRA微调现有LLM,这受限于LLM与嵌入模型之间的数据和训练差异。在这项工作中,我们介绍了Conan-embedding-v2,这是一个全新的1.4B参数LLM,从零开始训练并微调为文本嵌入器。首先,我们在LLM预训练中加入了新闻数据和多语言对,以弥合数据差异。基于此,我们提出了一个跨语言检索数据集,使LLM能够更好地整合不同语言间的嵌入。其次,LLM使用因果掩码和词元级损失,而嵌入模型使用双向掩码和句子级损失。这种训练差异使得全量微调的效果不如LoRA。我们引入了一种软掩码机制,以在这两种掩码类型之间逐步过渡,使模型能够学习更全面的表示。基于此,我们提出了一种动态难负样本挖掘方法,在整个训练过程中让模型接触到更难的负样本。Conan-embedding-v2直观且有效,仅用约1.4B参数,就在大规模文本嵌入基准(MTEB)和中文MTEB(2025年5月19日)上均达到了SOTA性能。

关键词

引用

@article{arxiv.2509.12892,
  title  = {Conan-Embedding-v2: Training an LLM from Scratch for Text Embeddings},
  author = {Shiyu Li and Yang Tang and Ruijie Liu and Shi-Zhe Chen and Xi Chen},
  journal= {arXiv preprint arXiv:2509.12892},
  year   = {2025}
}

备注

EMNLP 2025 Oral