中文

通过提示工程和对比微调实现大型语言模型文本嵌入的资源高效适配

计算与语言 2025-09-25 v2

摘要

大型语言模型(LLM)已成为自然语言处理(NLP)中的核心技术,凭借在文本生成方面的卓越表现备受关注。其基于 token 的表示捕获了丰富且符合人类认知的语义信息。然而,将这些向量进行池化以生成文本嵌入会丢失关键信息。尽管如此,许多非生成性下游任务(如聚类、分类或检索)仍依赖于准确且可控的句子或文档级嵌入。我们探索了几种针对预训练的解码器型 LLM 的适配策略:(i)token 嵌入的各种聚合技术,(ii)任务特定的提示工程,(iii)通过对比微调实现的文本级数据增强。将这些组件组合搭载,可在 Massive Text Embedding Benchmark(MTEB)英文聚类赛道上取得具竞争力的性能。进一步分析注意力图表表明,微调后模型从提示 token 转向语义相关词汇,从而实现了对最终隐藏状态中语义信息的更有效压缩。我们的实验表明,借助提示工程与资源高效的对比微调(针对合成的正负样本对),大型语言模型可被有效适配为文本嵌入模型。

关键词

引用

@article{arxiv.2507.22729,
  title  = {Resource-Efficient Adaptation of Large Language Models for Text Embeddings via Prompt Engineering and Contrastive Fine-tuning},
  author = {Benedikt Roth and Stephan Rappensperger and Tianming Qiu and Hamza Imamović and Julian Wörmann and Hao Shen},
  journal= {arXiv preprint arXiv:2507.22729},
  year   = {2025}
}