用于动作识别与检测的空间-时间对齐网络
计算机视觉与模式识别
2020-12-07 v1
摘要
本文研究如何引入视角不变的特征表示以帮助动作识别与检测。尽管在过去十年中我们见证了动作识别的巨大进展,如何高效建模大规模数据集中的几何变化仍具挑战且有趣。本文提出一种新颖的空间-时间对齐网络(STAN),旨在为动作识别和动作检测学习几何不变表示。STAN模型非常轻量且通用,可以以极低的额外计算成本插入现有的动作识别模型如ResNet3D和SlowFast中。我们在AVA、Kinetics-400、AVA-Kinetics、Charades和Charades-Ego数据集上广泛测试了我们的STAN模型。实验结果表明,STAN模型能在动作检测和动作识别任务中持续提升最优(SOTA)水平。我们将发布我们的数据、模型和代码。
引用
@article{arxiv.2012.02426,
title = {Spatial-Temporal Alignment Network for Action Recognition and Detection},
author = {Junwei Liang and Liangliang Cao and Xuehan Xiong and Ting Yu and Alexander Hauptmann},
journal= {arXiv preprint arXiv:2012.02426},
year = {2020}
}