中文

听而观之:通过预览音频进行动作识别

计算机视觉与模式识别 2020-03-31 v3 机器学习 声音 音频与语音处理

摘要

面对视频数据洪流,当今昂贵的片段级分类器愈发不切实际。我们提出一种在非裁剪视频中高效动作识别的框架,该框架利用音频作为预览机制以消除短期与长期视觉冗余。首先,我们设计 ImgAud2Vid 框架,通过从更轻的模态——单帧及其伴随音频——中蒸馏来幻觉出片段级特征,从而降低短期时间冗余以实现高效片段级识别。其次,在 ImgAud2Vid 基础上,我们进一步提出 ImgAud-Skimming,一种基于注意力的长短期记忆网络,可迭代选取非裁剪视频中的有用时刻,从而降低长期时间冗余以实现高效视频级识别。在四个动作识别数据集上的大量实验表明,我们的方法在识别精度与速度方面均达到最优水平。

关键词

引用

@article{arxiv.1912.04487,
  title  = {Listen to Look: Action Recognition by Previewing Audio},
  author = {Ruohan Gao and Tae-Hyun Oh and Kristen Grauman and Lorenzo Torresani},
  journal= {arXiv preprint arXiv:1912.04487},
  year   = {2020}
}

备注

Appears in CVPR 2020; Project page: http://vision.cs.utexas.edu/projects/listen_to_look/