中文

负样本至关重要:面向增强文本嵌入的多粒度困难负样本合成与锚点词元感知池化

计算与语言 2025-09-03 v1

摘要

文本嵌入模型对于各种自然语言处理任务至关重要,能够将语义信息有效编码为稠密向量表示。这些模型通常使用(查询,正样本,负样本)三元组数据进行对比学习优化,其中负样本在增强模型辨别细微语义差异的能力方面起着关键作用。在这项工作中,我们引入了一种多粒度困难负样本(MGH)合成框架,该框架利用大型语言模型(LLM)生成与查询具有不同相似度的多样化负样本。这种方法在监督训练期间促进了从粗到细的课程学习策略,使嵌入模型能够逐步学习更细致的语义表示。同时,我们提出了一种锚点词元感知(ATA)池化方法,该方法基于在LLM中观察到的聚合模式为锚点词元分配更高权重,从而在不增加模型复杂度的情况下提高文本嵌入精度。在MTEB基准上的综合实验表明,我们的方法达到了最先进的性能,无论是在仅使用合成数据还是与公共检索数据集结合时,都超越了现有的合成策略。

关键词

引用

@article{arxiv.2509.00842,
  title  = {Negative Matters: Multi-Granularity Hard-Negative Synthesis and Anchor-Token-Aware Pooling for Enhanced Text Embeddings},
  author = {Tengyu Pan and Zhichao Duan and Zhenyu Li and Bowen Dong and Ning Liu and Xiuxing Li and Jianyong Wang},
  journal= {arXiv preprint arXiv:2509.00842},
  year   = {2025}
}