通过压缩与对齐追踪大语言模型嵌入的自回归本质
计算与语言
2025-10-17 v3
摘要
一种新趋势将大语言模型用作稠密文本编码器,通过对比学习实现。然而,由于大语言模型嵌入会预测下一个 token 的概率分布,它们本质上是生成式和分布式的,这与对比学习的要求不符——后者需要嵌入捕获完整文本语义并通过余弦相似度进行对齐。这种差异阻碍了充分利用大语言模型预训练能力,导致学习效率低下。针对此问题,我们提出 AutoRegEmbed,一种基于嵌入条件概率分布的新型对比学习方法,集成两个核心任务:信息压缩和条件分布对齐。信息压缩任务将文本编码到嵌入空间,确保嵌入向量捕获全局语义。条件分布对齐任务通过利用嵌入的条件分布来对齐文本嵌入与正样本嵌入,同时降低从文本嵌入生成负样本的可能性,从而实现嵌入的对齐性和均匀性。实验结果表明,我们的方法在使用相同数据量时,显著优于传统对比学习方法,并与最先进的模型性能相当。
引用
@article{arxiv.2502.11401,
title = {Following the Autoregressive Nature of LLM Embeddings via Compression and Alignment},
author = {Jingcheng Deng and Zhongtao Jiang and Liang Pang and Liwei Chen and Kun Xu and Zihao Wei and Huawei Shen and Xueqi Cheng},
journal= {arXiv preprint arXiv:2502.11401},
year = {2025}
}