中文

预测枢纽是LLM中由上下文信息调制的高频标记

计算与语言 2025-10-20 v2 人工智能

摘要

枢纽化(hubness)指少数数据点在大多数其他点的最近邻中占据优势位置,常发生在将标准距离度量应用于高维数据时,常对基于距离的分析造成负面影响。由于自回归大语言模型(LLM) operate on high-dimensional representations,我们质疑它们是否也受枢纽化影响。我们首先证明,LLM唯一进行的大规模表示比较操作——即在上下文向量和解嵌入向量之间进行的比较,用于确定续写概率——不受导致异常枢纽化出现的距离浓缩现象的特征化。随后,我们经验性地表明,这种比较仍导致高度枢纽化,但这种情况下,枢纽并非扰动,而是结果是上下文调制的高频标记常出现在下一个标记预测的候选池中。然而,当使用其他距离度量比较LLM表示时,我们没有相同的理论保证,确实会出现异常枢纽。主要结论有两点:其一,尽管枢纽化在高维空间中普遍存在,但在LLM用于下一个标记预测时,並非需要消除的负面特性。其二,在使用欧几里得距离或余弦距离比较LLM表示时,存在高风险的异常枢纽,实践者应在相关情况下使用消除技术。

关键词

引用

@article{arxiv.2502.10201,
  title  = {Prediction hubs are context-informed frequent tokens in LLMs},
  author = {Beatrix M. G. Nielsen and Iuri Macocco and Marco Baroni},
  journal= {arXiv preprint arXiv:2502.10201},
  year   = {2025}
}

备注

Published as a conference paper at ACL 2025