用于音频源分离的视觉场景图
计算机视觉与模式识别
2021-09-27 v1 人工智能
机器学习
声音
音频与语音处理
摘要
最先进的视觉引导音频源分离方法通常假设声源具有特征性声音,例如乐器。这些方法往往忽略这些声源的视觉上下文,或避免对物体交互建模,而物体交互可能有助于更好地刻画声源,尤其当同一物体类别因不同交互可能产生不同声音时。为解决这一挑战性问题,我们提出音频视觉场景图分割器(Audio Visual Scene Graph Segmentor, AVSGS),一种新颖的深度学习模型,它将场景的视觉结构嵌入为图并将该图分割为子图,每个子图通过音频频谱图的共分割与一种唯一声音相关联。AVSGS 的核心是使用递归神经网络,借助多头注意力机制发出视觉图的互正交子图嵌入。这些嵌入用于调节音频编码器-解码器以实现源分离。我们的流水线通过自监督任务端到端训练,该任务由使用来自人工混合声音中的视觉图分离音频源组成。在本文中,我们还引入了一个用于声音源分离的“野外”视频数据集,其包含多个非音乐声源,称为 Audio Separation in the Wild (ASIW)。该数据集改编自 AudioCaps 数据集,为源分离提供了具有挑战性、自然且日常生活的设定。在提出的 ASIW 和标准 MUSIC 数据集上的详尽实验证明了我们的方法相对于近期已有方法具有最先进的声源分离性能。
引用
@article{arxiv.2109.11955,
title = {Visual Scene Graphs for Audio Source Separation},
author = {Moitreya Chatterjee and Jonathan Le Roux and Narendra Ahuja and Anoop Cherian},
journal= {arXiv preprint arXiv:2109.11955},
year = {2021}
}
备注
Accepted at ICCV 2021