无意义 Token 带来的实质性提升:激活偏移如何增强大语言模型的推理能力
机器学习
2025-10-02 v1
摘要
着手于插入一系列无意义 token 后,大语言模型推理性能持续提升的颠覆性现象观察,本文分析其背后机制,并基于这些洞见提出更为原则的方法以实现类似的性能提升。首先,我们发现性能提升源于大语言模型中 MLP 层激活的重新分布:接近零的激活变得更少,而大幅度激活则增加。这种重新分布通过抑制弱信号、强化更强、更具信息性的信号,从而提升模型的表征能力。基于此洞见,我们提出激活重新分配模块(Activation Redistribution Module, ARM),这是一种轻量级推理时技术,通过直接修改激活而不改变输入序列,实现类似无意义 token 所带来的效应。广泛的实验在多样化基准和模型架构上均表明,ARM 在推理任务中稳定提升大语言模型性能,且仅需数行简单代码即可实现。我们的发现既为无意义 token 带来的意外效益提供了清晰的机制解释,也提出一种简洁有效的技术,利用激活重新分配进一步提升大语言模型性能。
引用
@article{arxiv.2510.01032,
title = {Meaningless Tokens, Meaningful Gains: How Activation Shifts Enhance LLM Reasoning},
author = {Zeru Shi and Yingjia Wan and Zhenting Wang and Qifan Wang and Fan Yang and Elisa Kreiss and Ruixiang Tang},
journal= {arXiv preprint arXiv:2510.01032},
year = {2025}
}