利用门控多级注意力与时序对抗训练增强Transformer的视频理解能力
计算机视觉与模式识别
2021-03-19 v1 机器学习
多媒体
摘要
Transformer 模型的引入带来了序列建模尤其是文本领域的巨大进展。然而,基于注意力的模型在视频理解中的使用仍相对未被充分探索。本文中,我们引入门控对抗 Transformer(GAT)以增强基于注意力的模型在视频上的适用性。GAT 使用多级注意力门基于局部与全局上下文对帧的相关性建模,使模型能在多种粒度上理解视频。此外,GAT 使用对抗训练以提升模型泛化能力。我们提出时序注意力正则化方案以增强注意力模块对对抗样本的鲁棒性。我们在大规模 YouTube-8M 数据集上就视频分类任务展示了 GAT 的性能,并进一步给出消融研究及定量与定性分析以展现改进。
引用
@article{arxiv.2103.10043,
title = {Enhancing Transformer for Video Understanding Using Gated Multi-Level Attention and Temporal Adversarial Training},
author = {Saurabh Sahu and Palash Goyal},
journal= {arXiv preprint arXiv:2103.10043},
year = {2021}
}