听而观之:通过预览音频进行动作识别
计算机视觉与模式识别
2020-03-31 v3 机器学习
声音
音频与语音处理
摘要
面对视频数据洪流,当今昂贵的片段级分类器愈发不切实际。我们提出一种在非裁剪视频中高效动作识别的框架,该框架利用音频作为预览机制以消除短期与长期视觉冗余。首先,我们设计 ImgAud2Vid 框架,通过从更轻的模态——单帧及其伴随音频——中蒸馏来幻觉出片段级特征,从而降低短期时间冗余以实现高效片段级识别。其次,在 ImgAud2Vid 基础上,我们进一步提出 ImgAud-Skimming,一种基于注意力的长短期记忆网络,可迭代选取非裁剪视频中的有用时刻,从而降低长期时间冗余以实现高效视频级识别。在四个动作识别数据集上的大量实验表明,我们的方法在识别精度与速度方面均达到最优水平。
引用
@article{arxiv.1912.04487,
title = {Listen to Look: Action Recognition by Previewing Audio},
author = {Ruohan Gao and Tae-Hyun Oh and Kristen Grauman and Lorenzo Torresani},
journal= {arXiv preprint arXiv:1912.04487},
year = {2020}
}
备注
Appears in CVPR 2020; Project page: http://vision.cs.utexas.edu/projects/listen_to_look/