面向长视频理解的视频令牌合并
计算机视觉与模式识别
2024-11-01 v1
摘要
随着视频理解的数据和模型规模迅速扩大,在基于 Transformer 的模型中处理长视频输入提出了一个实际挑战。与可能导致信息丢失的输入采样或令牌丢弃不同,令牌合并在与 Transformer 协作使用时显示出有前景的结果。然而,将令牌合并应用于长视频处理并非易事。我们从一个前提开始:令牌合并不应仅仅依赖于视频令牌的相似性;令牌的显著性也应被考虑。为了解决这个问题,我们探索了用于长视频分类的各种视频令牌合并策略,从图像令牌合并的简单扩展开始,到区域集中合并,最后提出了一种可学习的视频令牌合并(VTM)算法,该算法根据令牌的显著性动态合并令牌。大量实验结果表明,我们在 LVU、COIN 和 Breakfast 数据集上取得了更好或相当的性能。此外,与基线算法相比,我们的方法显著降低了 84% 的内存成本,并将吞吐量提升了约 6.89 倍。
引用
@article{arxiv.2410.23782,
title = {Video Token Merging for Long-form Video Understanding},
author = {Seon-Ho Lee and Jue Wang and Zhikang Zhang and David Fan and Xinyu Li},
journal= {arXiv preprint arXiv:2410.23782},
year = {2024}
}
备注
21 pages, NeurIPS 2024