中文

Token前置:一种从大语言模型中引出更好句子嵌入的免训练方法

计算与语言 2025-07-04 v2 人工智能

摘要

从大语言模型(LLM)中提取句子嵌入是一个有前景的方向,因为LLM展现了更强的语义理解能力。以往的研究通常侧重于通过提示工程,引导模型将句子信息编码到最后一个token的嵌入中,从而从LLM中获取句子嵌入。然而,LLM大多是仅解码器模型,采用因果注意力机制,句子中较早的token无法关注到后面的token,导致句子信息编码存在偏差,并对最终解码的token产生级联影响。为此,我们提出了一种新颖的Token前置(TP)技术,该技术将每一层解码后的句子嵌入前置到下一层输入的句子开头,使得在因果注意力机制下,较早的token能够关注到完整的句子信息。所提出的TP技术是一种即插即用且免训练的技术,这意味着它可以无缝集成到各种基于提示的句子嵌入方法和自回归LLM中。在多种语义文本相似度(STS)任务和下游分类任务上的大量实验表明,我们提出的TP技术能够显著提升现有基于提示的句子嵌入方法在不同LLM上的性能,同时仅增加可忽略的额外推理成本。

关键词

引用

@article{arxiv.2412.11556,
  title  = {Token Prepending: A Training-Free Approach for Eliciting Better Sentence Embeddings from LLMs},
  author = {Yuchen Fu and Zifeng Cheng and Zhiwei Jiang and Zhonghui Wang and Yafeng Yin and Zhengliang Li and Qing Gu},
  journal= {arXiv preprint arXiv:2412.11556},
  year   = {2025}
}

备注

Accept to ACL 2025 (Oral). Code are available on https://github.com/fuyuchenIfyw/token_prepending.git