中文

视频,你的 Token 是如何合并的?

计算机视觉与模式识别 2025-10-24 v1

摘要

视频 Transformer 模型由于输入的空时扩展需要大量计算资源。为解决这一问题,近期方法提出了针对图像模型的 Token 丢弃或合并策略,无论是随机还是通过学习方式。Token 合并具有诸多优势:它可以插入任何视觉 Transformer,无需模型重新训练,并且能够传播否则会被丢弃的信息。此前,视频 Token 合并尚未在具有时间复杂性的视频理解数据集上进行评估。在本工作中,我们探索了视频的无训练 Token 合并,在四个视频 Transformer 上进行了全面实验,并在三个表现出粗粒度和细粒度动作识别的数据集上找到了最佳实践。我们的结果展示了视频 Token 合并的优势,在保持准确率的同时实现了约 2.5 倍的速度提升(ViViT 平均 -0.55%)。代码可在 https://github.com/sjpollard/video-how-do-your-tokens-merge 获取。

关键词

引用

@article{arxiv.2506.03885,
  title  = {Video, How Do Your Tokens Merge?},
  author = {Sam Pollard and Michael Wray},
  journal= {arXiv preprint arXiv:2506.03885},
  year   = {2025}
}

备注

Accepted at eLVM workshop at CVPR 2025