重新思考视频 ViT:用于图像与视频联合学习的稀疏视频管
计算机视觉与模式识别
2022-12-07 v1
摘要
我们提出了一种简单方法,可将 ViT 编码器转变为高效的视频模型,该模型能无缝处理图像和视频输入。通过对输入进行稀疏采样,模型能够从两种输入中进行训练和推理。该模型易于扩展,并可适配大规模预训练 ViT,而无需完整微调。该模型取得了 SOTA 结果,代码将开源。
引用
@article{arxiv.2212.03229,
title = {Rethinking Video ViTs: Sparse Video Tubes for Joint Image and Video Learning},
author = {AJ Piergiovanni and Weicheng Kuo and Anelia Angelova},
journal= {arXiv preprint arXiv:2212.03229},
year = {2022}
}