利用场景图学习视听动态以进行音频源分离
声音
2022-11-01 v1 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
静态声源与运动声源所产生的声音存在明确区别,尤其当声源朝向或远离麦克风运动时。本文提出利用音频与视觉动态之间的这一关联同时解决两项挑战性任务,即:(i) 利用视觉线索从混合音频中分离音频源,以及 (ii) 利用分离出的音频预测发声源的3D视觉运动。为此,我们提出音频分离器与运动预测器(ASMP)——一种利用场景3D结构与声源运动以实现更优音频源分离的深度学习框架。ASMP的核心是一个2.5D场景图,捕获视频中各类物体及其伪3D空间邻近关系。该图通过配准2D视频帧的2.5D单目深度预测,并将2.5D场景区域与应用于这些帧的目标检测器输出相关联来构建。ASMP任务随后被数学建模为联合问题:(i) 递归地将2.5D场景图分割为若干子图,每个子图与输入音频混合中的组成声音相关联(随后被分离),以及 (ii) 从分离音频预测对应声源的3D运动。为实证评估ASMP,我们在两个挑战性视听数据集即Audio Separation in the Wild (ASIW) 与Audio Visual Event (AVE) 上开展实验。结果表明,ASMP在源分离质量上取得明显改进,在两个数据集上均优于先前工作,同时比其他方法更好地估计声源运动方向。
引用
@article{arxiv.2210.16472,
title = {Learning Audio-Visual Dynamics Using Scene Graphs for Audio Source Separation},
author = {Moitreya Chatterjee and Narendra Ahuja and Anoop Cherian},
journal= {arXiv preprint arXiv:2210.16472},
year = {2022}
}
备注
Accepted at NeurIPS 2022