中文

PatchBlender:一种用于视频 Transformer 的运动先验

计算机视觉与模式识别 2023-02-14 v2 人工智能 机器学习

摘要

Transformer 已成为计算机视觉领域的主导架构之一。然而,将此类架构应用于视频数据时仍存在若干挑战。最显著的是,这些模型难以有效建模视频数据的时间模式。针对这一问题,我们提出了 PatchBlender,一种可学习的混合函数,在潜空间的时间维度上对图像块嵌入进行操作。我们表明,我们的方法能够成功使视觉 Transformer 编码视频数据的时间分量。在 Something-Something v2 和 MOVi-A 上,我们展示了我们的方法提升了视频 Transformer 的基线性能。PatchBlender 的优势在于几乎兼容任何 Transformer 架构,并且由于它是可学习的,模型可以自适应地开启或关闭该先验。它在计算上也极为轻量,仅消耗 ViT-B 的 0.005% GFLOPs。

关键词

引用

@article{arxiv.2211.14449,
  title  = {PatchBlender: A Motion Prior for Video Transformers},
  author = {Gabriele Prato and Yale Song and Janarthanan Rajendran and R Devon Hjelm and Neel Joshi and Sarath Chandar},
  journal= {arXiv preprint arXiv:2211.14449},
  year   = {2023}
}