Router-Tuning:一种用于在 Transformer 中实现动态深度的简单有效方法
计算与语言
2025-09-15 v6
摘要
传统的 transformer 模型为每个输入 token 分配固定数量的计算资源,导致低效且不必要的计算。为此,引入了深度混合(MoD)以动态调整计算深度,通过跳过不重要的层来实现。尽管其前景光明,当前的 MoD 方法仍未得到充分探索,面临两个主要挑战:(1)由于需要训练整个模型以及决定要跳过哪些层的路由器,训练成本高;(2)在重要层被跳过时,性能可能下降。在针对第一个问题方面,我们提出了 Router-Tuning 方法,仅在小型数据集上微调路由器,大幅降低了与完整模型训练相关的计算开销。针对第二个问题,我们提出了 MindSkip 方法,部署带有动态深度的注意力机制。该方法在保持模型性能的同时,显著提升了计算和内存效率。广泛的实验表明,我们的方法在交叉结果方面具有竞争力,同时大幅提高了计算效率,例如实现 21% 的加速并仅有 0.2% 的性能下降。代码已发布于 https://github.com/CASE-Lab-UMD/Router-Tuning。
关键词
引用
@article{arxiv.2410.13184,
title = {Router-Tuning: A Simple and Effective Approach for Enabling Dynamic-Depth in Transformers},
author = {Shwai He and Tao Ge and Guoheng Sun and Bowei Tian and Xiaoyang Wang and Dong Yu},
journal= {arXiv preprint arXiv:2410.13184},
year = {2025}
}
备注
EMNLP 2025 Main Conference