统一多感官感知:弱监督音视频视频解析
计算机视觉与模式识别
2020-07-23 v1 多媒体
声音
音频与语音处理
摘要
在本文中,我们引入了一个新问题,称为音视频视频解析,旨在将视频解析为时间事件片段并将其标注为可听、可见或两者兼有。该问题对于完整理解视频所描绘的场景至关重要。为促进探索,我们收集了 Look, Listen, and Parse (LLP) 数据集,以弱监督方式研究音视频视频解析。该任务可自然表述为多模态多示例学习 (MMIL) 问题。具体而言,我们提出一种新颖的混合注意力网络,同时探索单模态与跨模态时间上下文。我们开发了注意力 MMIL 池化方法,以自适应地从不同时间范围和模态中挖掘有用的音频与视觉内容。此外,我们分别通过个体引导学习机制与标签平滑技术发现并缓解了模态偏差与噪声标签问题。实验结果表明,即便仅使用视频级弱标签,也能实现具有挑战性的音视频视频解析。我们提出的框架能有效利用单模态与跨模态时间上下文,并缓解模态偏差与噪声标签问题。
引用
@article{arxiv.2007.10558,
title = {Unified Multisensory Perception: Weakly-Supervised Audio-Visual Video Parsing},
author = {Yapeng Tian and Dingzeyu Li and Chenliang Xu},
journal= {arXiv preprint arXiv:2007.10558},
year = {2020}
}
备注
ECCV 2020 (Spotlight)