中文

LGAI-EMBEDDING-Preview 技术报告

计算与语言 2025-06-24 v2

摘要

本报告提出了一种统一的指令基框架,用于学习针对信息检索(IR)和非IR任务优化的通用文本嵌入。该方法基于解码器-only 大型语言模型(Mistral-7B),结合上下文学习、软监督和自适应硬负难采样,生成无需任务特定微调的上下文感知嵌入。通过结构化指令和少量样本示例,引导模型在多样化任务上实现卓越表现,包括分类、语义相似性、聚类和排序基准。为提升语义判别能力,我们采用软标签框架,其中来自高性能密集检索器和排序器的连续相关性得分作为细粒度监督信号。此外,我们引入基于自适应边际的硬负难采样方法,依据其与正例的相似度过滤掉语义模糊的负样本,从而增强训练稳定性和检索鲁棒性。我们的模型在覆盖41个七类任务的全新MTEB(英文,v2)基准上进行评估。结果表明,该方法实现了强大的泛化能力,按Borda评分排名位列前列,超越了若干更大或完全微调的基线模型。这些发现凸显了结合上下文提示、软监督和自适应采样在可扩展高质量嵌入生成方面的有效性。

关键词

引用

@article{arxiv.2506.07438,
  title  = {LGAI-EMBEDDING-Preview Technical Report},
  author = {Jooyoung Choi and Hyun Kim and Hansol Jang and Changwook Jun and Kyunghoon Bae and Hyewon Choi and Stanley Jungkyu Choi and Honglak Lee and Chulmin Yun},
  journal= {arXiv preprint arXiv:2506.07438},
  year   = {2025}
}

备注

10 pages