高效视频理解的视觉令牌原理
计算机视觉与模式识别
2025-03-25 v2
摘要
视频理解近年来取得了巨大进步,主要依赖于Transformer的强大能力。由于这种架构以昂贵著称,且视频数据高度冗余,提高效率的研究变得尤为重要。一些创造性解决方案包括令牌选择和合并。虽然大多数方法成功降低了模型成本并保持了准确性,但出现了一个有趣的模式:大多数方法并未优于随机丢弃令牌的基线。在本文中,我们更仔细地研究了这一现象,并观察了视觉令牌性质的5个原理。例如,我们观察到令牌的价值遵循清晰的帕累托分布,其中大多数令牌价值极低,只有少数携带了大部分感知信息。基于这些以及进一步的见解,我们提出了一个轻量级视频模型LITE,它可以有效地选择少量令牌,在计算量(GFLOPs)与准确性的艰难权衡中,在数据集(Kinetics-400和Something-Something-V2)上优于最先进方法和现有基线。实验还表明,LITE可以跨数据集甚至其他任务泛化,无需重新训练。
引用
@article{arxiv.2411.13626,
title = {Principles of Visual Tokens for Efficient Video Understanding},
author = {Xinyue Hao and Gen Li and Shreyank N Gowda and Robert B Fisher and Jonathan Huang and Anurag Arnab and Laura Sevilla-Lara},
journal= {arXiv preprint arXiv:2411.13626},
year = {2025}
}