中文

重新思考视频 ViT:用于图像与视频联合学习的稀疏视频管

计算机视觉与模式识别 2022-12-07 v1

摘要

我们提出了一种简单方法,可将 ViT 编码器转变为高效的视频模型,该模型能无缝处理图像和视频输入。通过对输入进行稀疏采样,模型能够从两种输入中进行训练和推理。该模型易于扩展,并可适配大规模预训练 ViT,而无需完整微调。该模型取得了 SOTA 结果,代码将开源。

关键词

引用

@article{arxiv.2212.03229,
  title  = {Rethinking Video ViTs: Sparse Video Tubes for Joint Image and Video Learning},
  author = {AJ Piergiovanni and Weicheng Kuo and Anelia Angelova},
  journal= {arXiv preprint arXiv:2212.03229},
  year   = {2022}
}