中文

ToSA:基于空间感知的 Token 合并

机器学习 2025-06-26 v1 应用统计

摘要

Token 合并已成为加速视觉 Transformer(ViT)的有效策略,通过减少计算成本实现。然而,现有方法主要依赖视觉 token 的特征相似性进行 token 合并,忽视了整合空间信息的潜力——在 ViT 的早期层中,视觉 token 仅拥有较弱的视觉信息,而空间信息可作为 token 合并的可靠标准。本文提出 ToSA,一种将语义和空间感知相结合的新颖 token 合并方法。ToSA 利用深度图作为输入生成伪空间 token,这些 token 作为视觉 token 合并过程的辅助空间信息。通过引入空间感知,ToSA 实现了更有信息量的合并策略,更好地保留了关键场景结构。实验结果表明,ToSA 在视觉和具身问答等多个基准上超越了之前的 token 合并方法,同时大幅降低了 ViT 的运行时间,成为 ViT 加速的高效解决方案。代码将在:https://github.com/hsiangwei0903/ToSA 提供。

关键词

引用

@article{arxiv.2506.20065,
  title  = {Supervised Coupled Matrix-Tensor Factorization (SCMTF) for Computational Phenotyping of Patient Reported Outcomes in Ulcerative Colitis},
  author = {Cristian Minoccheri and Sophia Tesic and Kayvan Najarian and Ryan Stidham},
  journal= {arXiv preprint arXiv:2506.20065},
  year   = {2025}
}