基于 LLM 的嵌入:注意力值比隐藏状态更好地编码句子语义
计算与语言
2026-02-03 v1 信息检索
摘要
句子表示是许多自然语言处理 (NLP) 应用的基础。虽然最近的方法利用大型语言模型 (LLM) 来推导句子表示,但大多数依赖最终层的隐藏状态,而这些隐藏状态是为预测下一个标记而优化的,因此往往无法捕获全局、句子级的语义。本文提出了一种新视角,表明注意力值向量比隐藏状态更有效地捕获句子语义。我们提出了值聚合 (Value Aggregation, VA),一种一种简单的方法,通过聚合多个层和标记索引上的标记值来实现。在无训练设置下,VA 的性能优于其他 LLM 嵌入方法,甚至可以匹配或超越基于集合的 MetaEOL。进一步地,我们展示,当配合合适的提示时,层注意力输出可以被解释为对齐的加权值向量。具体而言,最后一个标记的注意力分数作为权重,而输出投影矩阵 () 将这些加权值向量与 LLM 残差流的公共空间对齐。这种精炼方法称为对齐加权 VA (Aligned Weighted VA, AlignedWVA),在无训练 LLM 嵌入中实现了最先进的性能,显著优于高成本的 MetaEOL。最后,我们强调通过对值聚合进行微调可获取强大 LLM 嵌入模型的潜力。
引用
@article{arxiv.2602.01572,
title = {LLM-based Embeddings: Attention Values Encode Sentence Semantics Better Than Hidden States},
author = {Yeqin Zhang and Yunfei Wang and Jiaxuan Chen and Ke Qin and Yizheng Zhao and Cam-Tu Nguyen},
journal= {arXiv preprint arXiv:2602.01572},
year = {2026}
}