利用局部时间信息用于多模态场景分类
计算机视觉与模式识别
2021-10-28 v1 机器学习
摘要
鲁棒的视频场景分类模型应有效捕捉视频的空间(像素级)与时间(帧级)特征。具有自注意力的 Transformer 模型旨在给定令牌序列时为各令牌获取上下文表示,正日益流行于众多计算机视觉任务中。然而,基于 Transformer 的模型用于视频理解仍相对未被充分探索。此外,这些模型未能利用相邻视频帧间的强时间关系来获得有力的帧级表示。本文提出一种新颖的自注意力模块,利用视频帧间局部与全局时间关系,为各帧获得更好的上下文表示。这使模型能在多种粒度上理解视频。我们在大规模 YouTube-8M 数据集上展示了模型于视频分类任务上的性能,并进一步分析结果以展现改进。
引用
@article{arxiv.2110.13992,
title = {Leveraging Local Temporal Information for Multimodal Scene Classification},
author = {Saurabh Sahu and Palash Goyal},
journal= {arXiv preprint arXiv:2110.13992},
year = {2021}
}