超越Top-1:Transformer按顺序确定Top令牌
计算与语言
2024-10-29 v1 机器学习
摘要
理解Transformer的内部工作机制对于实现更准确和高效的预测至关重要。在本工作中,我们分析了Transformer在top-1预测变得固定之后(此前被称为“饱和事件”)的层中所执行的计算。我们将饱和事件的概念扩展到top-k令牌,证明在语言、视觉和语音模型中存在类似的饱和事件。我们发现这些饱和事件按照相应令牌排名的顺序发生,即模型首先决定排名第一的令牌,然后是排名第二的令牌,依此类推。这种现象似乎是Transformer架构所固有的,出现在不同的架构变体(仅解码器、仅编码器,以及在较小程度上完整的Transformer)中,甚至出现在未训练的Transformer中。我们为这种顺序饱和提出了一种任务转换的底层机制,其中任务k对应于预测第k个最可能的令牌,而饱和事件实际上是任务之间的离散转换。支持这一点的是,我们证明可以从隐藏层嵌入中预测当前任务。此外,使用一种干预方法,我们证明可以促使模型从一个任务切换到下一个任务。最后,利用我们的发现,我们引入了一种新颖的令牌级早退策略,该策略在平衡性能和效率方面超越了现有方法。
引用
@article{arxiv.2410.20210,
title = {Looking Beyond The Top-1: Transformers Determine Top Tokens In Order},
author = {Daria Lioubashevski and Tomer Schlank and Gabriel Stanovsky and Ariel Goldstein},
journal= {arXiv preprint arXiv:2410.20210},
year = {2024}
}