中文

使用单一 Vision Transformer 联合学习图像与视频

计算机视觉与模式识别 2023-08-22 v1

摘要

在本研究中,我们提出一种使用单一模型联合学习图像与视频的方法。通常,图像和视频往往由单独的模型进行训练。我们在本文中提出一种方法,将一批图像作为输入送入 Vision Transformer IV-ViT,同时送入一组通过晚期融合进行时间聚合的视频帧。给出了在两个图像数据集和两个动作识别数据集上的实验结果。

关键词

引用

@article{arxiv.2308.10533,
  title  = {Joint learning of images and videos with a single Vision Transformer},
  author = {Shuki Shimizu and Toru Tamaki},
  journal= {arXiv preprint arXiv:2308.10533},
  year   = {2023}
}

备注

MVA2023 (18th International Conference on Machine Vision Applications), Hamamatsu, Japan, 23-25 July 2023