视频动作 Transformer 网络
计算机视觉与模式识别
2019-05-20 v2
摘要
我们引入 Action Transformer 模型,用于识别并定位视频片段中的人体动作。我们改造了一种 Transformer 风格的架构,以聚合我们所欲分类动作之人周围时空上下文的特征。我们展示,通过使用高分辨率、特定于人物、类不可知的查询,模型自发学会跟踪个体人物并从他人动作中拾取语义上下文。此外,其注意力机制学会强调手与脸——这常对区分动作至关重要——除边界框与类标签外无任何显式监督。我们在 Atomic Visual Actions (AVA) 数据集上训练并测试我们的 Action Transformer 网络,仅使用原始 RGB 帧作为输入,即以显著优势超越最先进水平(state-of-the-art)。
引用
@article{arxiv.1812.02707,
title = {Video Action Transformer Network},
author = {Rohit Girdhar and João Carreira and Carl Doersch and Andrew Zisserman},
journal= {arXiv preprint arXiv:1812.02707},
year = {2019}
}
备注
CVPR 2019