中文

低采样率下音视频特征的时间双线性编码网络

计算机视觉与模式识别 2020-12-21 v1 机器学习

摘要

当前基于深度学习的视频分类架构通常在大量数据上以端到端方式训练,并需要庞大的计算资源。本文旨在以每秒1帧的采样率利用视频分类中的音视频信息。我们提出时间双线性编码网络(TBEN),利用双线性池化对音频和视觉的长程时间信息进行编码,并证明对于低采样率视频,双线性池化在时间维度上优于平均池化。我们还将标签层次结构嵌入TBEN以进一步提升分类器的鲁棒性。在FGA240细粒度分类数据集上使用TBEN的实验达到了新的最先进水平(hit@1=47.95%)。我们还探索了将TBEN与视觉语义和运动特征等多种解耦模态结合的可能性:在UCF101上以1 FPS采样进行的实验取得了接近最先进的准确率(hit@1=91.03%),同时在训练和预测上所需的计算资源均显著少于竞争方法。

关键词

引用

@article{arxiv.2012.10283,
  title  = {Temporal Bilinear Encoding Network of Audio-Visual Features at Low Sampling Rates},
  author = {Feiyan Hu and Eva Mohedano and Noel O'Connor and Kevin McGuinness},
  journal= {arXiv preprint arXiv:2012.10283},
  year   = {2020}
}

备注

8 pages