基于视听预测编码的视觉引导声源分离
声音
2023-06-21 v1 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
视觉引导声源分离框架通常由三部分组成:视觉特征提取、多模态特征融合与声音信号处理。该领域的一个持续趋势是为信息性视觉引导定制所涉及的视觉特征提取器,并单独设计特征融合模块,同时默认使用U-Net进行声音分析。然而,这种分而治之的范式参数效率低下,且由于联合优化与协调各模型组件颇具挑战,可能获得次优性能。相比之下,本文提出一种称为视听预测编码(AVPC)的新方法,以参数高效且更有效的方式解决该任务。AVPC的网络采用简单的基于ResNet的视频分析网络来推导语义视觉特征,以及基于预测编码的声源分离网络,该网络可在同一架构中提取音频特征、融合多模态信息并预测声源分离掩码。通过迭代最小化特征间的预测误差,AVPC递归地整合音频与视觉信息,从而获得逐步提升的性能。此外,我们通过协同预测同一声源的两个视听表示,为AVPC开发了一种有效的自监督学习策略。大量评估表明,AVPC在分离乐器声音方面优于多个基线,同时显著减小了模型规模。代码见:https://github.com/zjsong/Audio-Visual-Predictive-Coding。
引用
@article{arxiv.2306.10684,
title = {Visually-Guided Sound Source Separation with Audio-Visual Predictive Coding},
author = {Zengjie Song and Zhaoxiang Zhang},
journal= {arXiv preprint arXiv:2306.10684},
year = {2023}
}
备注
Accepted to IEEE Transactions on Neural Networks and Learning Systems (T-NNLS)