用于非同步音视频事件的弱监督表示学习
计算机视觉与模式识别
2018-07-10 v2 声音
音频与语音处理
摘要
音视频表示学习是从设计能够理解复杂事件的机器的角度来看的一项重要任务。为此,我们提出一种实例化多示例学习的新型多模态框架。我们表明所学表示可用于分类事件并定位其特征的音视频元素。该系统仅使用视频级事件标签训练,无任何时序信息。我们方法的一个重要特征是其从非同步音视频事件中学习的能力。我们在大规模弱标记音频事件视频数据集上取得了最先进(state-of-the-art)结果。对定位的视觉区域与音频片段的可视化证实了我们的系统效能,尤其在应对模态特定线索异步出现的噪声情形时。
引用
@article{arxiv.1804.07345,
title = {Weakly Supervised Representation Learning for Unsynchronized Audio-Visual Events},
author = {Sanjeel Parekh and Slim Essid and Alexey Ozerov and Ngoc Q. K. Duong and Patrick Pérez and Gaël Richard},
journal= {arXiv preprint arXiv:1804.07345},
year = {2018}
}