基于Sink Token正交性的高效LLM推理Token选择方法——OrthoRank
计算与语言
2025-08-19 v2 人工智能
机器学习
摘要
注意力机制是大型语言模型(LLM)成功的核心因素,使其能够捕捉复杂的token依赖关系,并隐式为每个token分配重要性。最近的研究揭示了sink token——尽管其语义角色有限,但接收的注意力显著高于其他token。在本文中,我们首先扩展了sink token与其他token之间的关系,超越注意力,探索它们在隐藏状态中的相似性,考虑层次深度。我们观察到,随着层次的加深,归一化隐藏状态之间sink token与其他token的余弦相似性增加,而sink token的归一化隐藏状态表现出可忽略的变化。这意味着其他token在各层次中始终指向sink token。接着,我们提出一种动态token选择方法,称为OrthoRank,利用这些发现来选择重要token。具体而言,在某一层次中,我们通过token移动向sink token的速度来定义token的重要性。这被转换为与sink token的正交性,意味着与sink token更正交的token被赋予更大的重要性。最终,通过大量实验,我们展示了该方法在相同稀疏度下相较于层级剪枝方法,实现更低的困惑度和更高的零样本准确率,同时在LongBench上获得更佳性能。
关键词
引用
@article{arxiv.2507.03865,
title = {OrthoRank: Token Selection via Sink Token Orthogonality for Efficient LLM inference},
author = {Seungjun Shin and Jaehoon Oh and Dokwan Oh},
journal= {arXiv preprint arXiv:2507.03865},
year = {2025}
}
备注
ICML 2025 (final version)