使用单一 Vision Transformer 联合学习图像与视频
计算机视觉与模式识别
2023-08-22 v1
摘要
在本研究中,我们提出一种使用单一模型联合学习图像与视频的方法。通常,图像和视频往往由单独的模型进行训练。我们在本文中提出一种方法,将一批图像作为输入送入 Vision Transformer IV-ViT,同时送入一组通过晚期融合进行时间聚合的视频帧。给出了在两个图像数据集和两个动作识别数据集上的实验结果。
引用
@article{arxiv.2308.10533,
title = {Joint learning of images and videos with a single Vision Transformer},
author = {Shuki Shimizu and Toru Tamaki},
journal= {arXiv preprint arXiv:2308.10533},
year = {2023}
}
备注
MVA2023 (18th International Conference on Machine Vision Applications), Hamamatsu, Japan, 23-25 July 2023