中文

学习压缩:探索大型语言模型用于文本表示的潜能

计算与语言 2025-12-25 v2 人工智能

摘要

文本表示在聚类、检索等下游任务中发挥关键作用。随着大型语言模型(LLM)的出现,越来越多的人关注如何利用其能力进行此目的。然而,大多数LLM本质上是因果式的,针对下一个标记预测进行优化,对于产生整体表示不够理想。为此,最近的研究引入了预文本任务来适配LLM以用于文本表示。大多数预文本任务依赖基于标记的预测目标,例如 LLM2Vec 所使用的掩码下一个标记预测(MNTP)。本文探索了上下文压缩作为LLM无监督适配的未开发潜能。在压缩预训练期间,模型学习生成紧凑记忆标记,这些标记取代下游序列预测的整个上下文。实验表明,设计良好的压缩目标显著提升LLM-based文本表示,超越基于标记级预文本任务训练的模型。通过对比学习进一步获得改进,产生的强大表示模型(LLM2Comp)在广泛的任务上超越当代LLM-based文本编码器,同时更高效,所需训练数据显著减少。代码可在 https://github.com/longtaizi13579/LLM2Comp 获取。

关键词

引用

@article{arxiv.2511.17129,
  title  = {Learning to Compress: Unlocking the Potential of Large Language Models for Text Representation},
  author = {Yeqin Zhang and Yizheng Zhao and Chen Hu and Binxing Jiao and Daxin Jiang and Ruihang Miao and Cam-Tu Nguyen},
  journal= {arXiv preprint arXiv:2511.17129},
  year   = {2025}
}

备注

Accepted by AAAI'26