动作即变换
计算机视觉与模式识别
2016-07-27 v2
摘要
什么是“踢球”这样的动作?我们认为,动作的真实含义在于动作给环境带来的变化或变换。本文中,我们提出一种新颖的动作表示,将动作建模为将动作发生前环境状态(先决条件)转变为动作发生后状态(效果)的变换。受近期使用深度学习的视频表示进展的启发,我们设计了一个孪生网络(Siamese network),将动作建模为高维特征空间上的变换。我们表明,我们的模型在包括UCF101和HMDB51在内的标准动作识别数据集上取得了改进。更重要的是,我们的方法能够泛化到未见过的动作类别之外,并在我们新的ACT数据集上的跨类别泛化中展现出显著的性能提升。
引用
@article{arxiv.1512.00795,
title = {Actions ~ Transformations},
author = {Xiaolong Wang and Ali Farhadi and Abhinav Gupta},
journal= {arXiv preprint arXiv:1512.00795},
year = {2016}
}