中文

利用声学图像的视听模型蒸馏

计算机视觉与模式识别 2020-02-12 v2 声音 音频与语音处理

摘要

本文研究了如何从视觉数据和声学图像(一种新颖的音频数据模态)中学习丰富且鲁棒的音频分类特征表示。以往的模型从单个麦克风获取的原始信号或频谱数据中学习音频表示,在分类和检索中取得了显著成果。然而,这些表示对于变化的环境声音条件并不鲁棒。我们通过利用一种混合视听传感器获取的新多模态标注动作识别数据集来克服这一缺点,该传感器提供RGB视频、原始音频信号和空间化声学数据(也称为声学图像),其中视觉和声学图像在空间上对齐、时间上同步。利用这些更丰富的信息,我们以教师-学生方式训练音频深度学习模型。特别地,我们从视觉教师和声学图像教师中蒸馏知识到音频网络。实验表明,与仅使用单麦克风音频数据训练的模型所学习的特征相比,学习到的表示更强大且具有更好的泛化能力。

关键词

引用

@article{arxiv.1904.07933,
  title  = {Audio-Visual Model Distillation Using Acoustic Images},
  author = {Andrés F. Pérez and Valentina Sanguineti and Pietro Morerio and Vittorio Murino},
  journal= {arXiv preprint arXiv:1904.07933},
  year   = {2020}
}

备注

Accepted at WACV 2020; supplementary material at page 11; code available at https://github.com/afperezm/acoustic-images-distillation