AdaMerge:面向视觉Transformer训练免费加速的盲尚感知自适应token合并
计算机视觉与模式识别
2026-05-28 v1 人工智能
摘要
视觉Transformer(ViT)中自注意力的二次方计算成本构成了实际部署的根本性瓶颈,激励了关于token降低的活跃研究。尽管已有方法,token合并(ToMe)已成为优雅的训练免费解决方案;但其设计基于未被正式确认的token平等性假设,这与自注意力中非均匀性的已知事实相矛盾,导致在激进压缩下高盲尚感知token信息丢失。在本文中,我们以AdaMerge形式提出的方法,基于两个互补机制。首先,盲尚感知加权相似性利用列式特征关联中心作为token重要性代理,并将结果盲尚得分纳入二分匹配得分,确保关键token对合并表示贡献更大。其次,自适应合并强度使用预计算的层级相似统计,动态调节特定输入下的每层减少计数,以适应输入相关的冗余度。在ImageNet-1k上使用ViT-B/16,AdaMerge在所有匹配FLOPs的 regime下均优于ToMe、PiToMe和DSM。在13.4G FLOPs operating point处,AdaMerge仅降低1.06%的Top-1准确率,而PiToMe为1.45%,DSM为4.62%。据我们了解,AdaMerge是首个将盲尚感知加权相似性和自适应每层减少融合于单一训练免费token合并框架的工作,推进了ViT加速的准确率-FLOPs帕累托前沿。
引用
@article{arxiv.2605.27465,
title = {AdaMerge: Salience-Aware Adaptive Token Merging for Training-Free Acceleration of Vision Transformers},
author = {Semi Lee and Hyejin Go and Hyesong Choi},
journal= {arXiv preprint arXiv:2605.27465},
year = {2026}
}
备注
11 pages, 3 figures, 5 tables. Submitted to NeurIPS 2026