DORA:面向视觉 Transformer 中 Token 合并的动态在线强化学习智能体
计算机视觉与模式识别
2026-05-13 v1
摘要
视觉 Transformer(ViTs)由于自注意力机制相对于 token 序列长度的二次复杂度,产生了显著的计算开销。虽然现有的 token 减少方法缓解了这一问题,但它们主要依赖于固定的启发式度量、预定义比率或静态离线掩码,缺乏在推理过程中捕捉输入相关冗余的适应性。在本文中,我们提出了 DORA(动态在线强化学习智能体),这是首个用于 ViTs 中动态 token 合并的强化学习(RL)驱动的在线推理框架。我们将合并过程建模为一个序列马尔可夫决策过程(MDP),其中轻量级 RL 智能体根据当前特征状态和层特定上下文确定每个 Transformer 块的合并策略。为了平衡计算效率和特征保真度,该智能体通过一个包含非线性蒸馏惩罚的密集奖励函数进行优化。我们实现了一种非对称的 Actor-Critic 架构,利用高容量 Critic 进行稳定的离线训练,同时保留最小化的 Actor 头用于低计算量的在线推理。跨多个 ViT 规模(Tiny 到 Large)的评估表明,与当前基线相比,DORA 改进了准确率-效率帕累托前沿。在严格的微小精度下降约束(<= 0.05%)下,DORA 实现了高达 12.66% 的 token 合并率,并且相对于最高效的基线,实现了高达 569.7% 的相对改进。在 ImageNet-1K 上,在对齐的精度约束下,DORA 在计算节省方面相比最先进的方法实现了高达 76% 的相对改进。此外,在分布外(OOD)基准测试(如 ImageNet-A 和 ImageNet-C)上,DORA 获得了超过 430% 的相对效率优势。
引用
@article{arxiv.2605.11683,
title = {DORA: Dynamic Online Reinforcement Agent for Token Merging in Vision Transformers},
author = {Kaixuan He and Song Chen and Yi Kang},
journal= {arXiv preprint arXiv:2605.11683},
year = {2026}
}
备注
Preprint. Under review