中文

Don't Look Twice: 基于游程标记化的更快视频 Transformer

计算机视觉与模式识别 2024-11-11 v1 机器学习

摘要

由于输入标记数量极其庞大,Transformer 在视频上训练缓慢,尽管许多视频标记会随时间重复出现。现有去除此类无信息标记的方法要么有显著开销从而抵消任何加速效果,要么需要针对不同数据集和样本进行调参。我们提出游程标记化(Run-Length Tokenization, RLT),一种受游程编码用于数据压缩启发的简单方法,用于加速视频 Transformer。RLT 在模型推理之前高效地识别并移除随时间重复的标记块,然后用一个标记和位置编码替换它们,以表示结果标记的新长度。我们的方法是内容感知的,无需针对不同数据集进行调参,且速度快,开销可忽略不计。RLT 在训练上带来了显著加速,将视频 Transformer 微调的挂钟时间减少了 30%,同时保持了基线模型的性能。RLT 也可以无需任何训练,将模型吞吐量提高 35%,仅带来 0.1% 的准确率下降。RLT 在 30 FPS 下将训练速度提升超过 100%,在更长视频数据集上可将标记数量减少高达 80%。我们的项目页面位于 https://rccchoudhury.github.io/projects/rlt/。

关键词

引用

@article{arxiv.2411.05222,
  title  = {Don't Look Twice: Faster Video Transformers with Run-Length Tokenization},
  author = {Rohan Choudhury and Guanglei Zhu and Sihan Liu and Koichiro Niinuma and Kris M. Kitani and László Jeni},
  journal= {arXiv preprint arXiv:2411.05222},
  year   = {2024}
}

备注

16 pages, 6 figures. Accepted to NeurIPS 2024 (spotlight)