面向 EPIC-KITCHENS-100 动作识别训练更强的视频视觉 Transformer
计算机视觉与模式识别
2021-06-10 v1
摘要
随着近期视觉 Transformer 研究的兴起,它们已展现出在诸多具挑战性的计算机视觉应用中的显著潜力,如图像识别、点云分类以及视频理解。本文中,我们给出在 EPIC-KITCHENS-100 动作识别数据集上训练更强视频视觉 Transformer 的实证结果。具体而言,我们探索视频视觉 Transformer 的训练技术,如数据增强、分辨率以及初始化等。借助我们的训练方案,单个 ViViT 模型在 EPIC-KITCHENS-100 数据集验证集上取得 47.4% 的性能,较原论文报道结果高出 3.4%。我们发现视频 Transformer 尤其擅长在动词—名词动作预测任务中预测名词,这使得视频 Transformer 的整体动作预测准确率显著高于卷积网络。令人惊讶的是,即便最优视频 Transformer 在动词预测上也逊于卷积网络。因此,我们结合视频视觉 Transformer 与部分卷积视频网络,给出了面向 EPIC-KITCHENS-100 动作识别竞赛的解决方案。
引用
@article{arxiv.2106.05058,
title = {Towards Training Stronger Video Vision Transformers for EPIC-KITCHENS-100 Action Recognition},
author = {Ziyuan Huang and Zhiwu Qing and Xiang Wang and Yutong Feng and Shiwei Zhang and Jianwen Jiang and Zhurong Xia and Mingqian Tang and Nong Sang and Marcelo H. Ang},
journal= {arXiv preprint arXiv:2106.05058},
year = {2021}
}
备注
CVPRW 2021, EPIC-KITCHENS-100 Competition Report