面向复杂动作识别的通用到专用框架
计算机视觉与模式识别
2020-07-14 v1
摘要
基于视频的动作识别近来在计算机视觉领域备受关注。为解决更复杂的识别任务,区分不同层次的类间差异变得必要。受基于人类决策过程的常见流程图启发——该流程先缩小可能类别的范围,再施加“重新思考”过程以实现更细粒度识别——我们提出了一种有效的通用到专用(U2S)框架用于复杂动作识别。U2S 框架由三个子网络组成:通用网络、类别专用网络和掩码网络。通用网络首先学习通用特征表示;掩码网络随后基于通用网络输出通过类别正则化生成针对易混淆类的注意力掩码;该掩码进一步用于引导类别专用网络学习类特定特征表示。整个框架以端到端方式优化。在多种基准数据集(如 Something-Something、UCF101 和 HMDB51 数据集)上的实验证明了 U2S 框架的有效性,即 U2S 能聚焦于易混淆类别的判别性时空区域。我们进一步可视化不同类之间的关系,表明 U2S 确实提升了所学特征的判别性。此外,所提 U2S 模型是一个通用框架,可采用任意基础识别网络。
引用
@article{arxiv.2007.06149,
title = {Universal-to-Specific Framework for Complex Action Recognition},
author = {Peisen Zhao and Lingxi Xie and Ya Zhang and Qi Tian},
journal= {arXiv preprint arXiv:2007.06149},
year = {2020}
}
备注
13 pages, 8 figures