我们从用于动作识别的深度表征中学到了什么?
计算机视觉与模式识别
2018-01-08 v1
摘要
随着深度模型在各种计算机视觉领域的成功部署,理解这些表征如何工作以及它们捕捉了什么变得愈发重要。在本文中,我们通过可视化双流模型为识别视频中人类动作所学到的内容,来阐明深度时空表征。我们表明,外观与运动物体的局部检测器涌现并形成用于识别人类动作的分布式表征。关键观察如下。首先,跨流融合使得学习真正的时空特征成为可能,而非仅仅是分离的外观与运动特征。其次,网络可以学习高度类别特定的局部表征,也可学习服务于一系列类别的通用表征。第三,在网络的整个层级中,特征变得更加抽象,并对数据中与所需区分无关方面(例如不同速度下的运动模式)表现出不断增强的不变性。第四,可视化不仅可用于阐明所学表征,还可用于揭示训练数据的特性并解释系统的失败案例。
引用
@article{arxiv.1801.01415,
title = {What have we learned from deep representations for action recognition?},
author = {Christoph Feichtenhofer and Axel Pinz and Richard P. Wildes and Andrew Zisserman},
journal= {arXiv preprint arXiv:1801.01415},
year = {2018}
}
备注
This document is best viewed in Adobe Reader where figures play on click. Supplementary material can be downloaded at http://feichtenhofer.github.io/action_vis.pdf