中文

SViTT:稀疏视频-文本Transformer的时间学习

计算机视觉与模式识别 2023-04-19 v1

摘要

视频-文本Transformer是否学习对跨帧时间关系进行建模?尽管其容量巨大且多模态训练数据丰富,近期工作揭示了视频-文本模型强烈倾向于基于帧的空间表征,而时间推理在很大程度上仍未解决。在本工作中,我们指出了视频-文本Transformer时间学习中的若干关键挑战:有限网络规模带来的时空权衡;多帧建模的维度灾难;以及通过延长片段长度所带来的语义信息收益递减。受这些发现的指导,我们提出SViTT,一种稀疏视频-文本架构,它以远低于具有稠密注意力的朴素Transformer的代价执行多帧推理。类似于基于图的网络,SViTT采用两种稀疏形式:限制自注意力中令牌间查询-键通信的边稀疏性,以及丢弃无信息视觉令牌的节点稀疏性。通过一种随片段长度增加模型稀疏度的课程进行训练,SViTT在多个视频-文本检索与问答基准上以极少的计算代价优于稠密Transformer基线。项目页面:http://svcl.ucsd.edu/projects/svitt。

关键词

引用

@article{arxiv.2304.08809,
  title  = {SViTT: Temporal Learning of Sparse Video-Text Transformers},
  author = {Yi Li and Kyle Min and Subarna Tripathi and Nuno Vasconcelos},
  journal= {arXiv preprint arXiv:2304.08809},
  year   = {2023}
}

备注

CVPR 2023