一种用于定位、分离与识别的统一音视觉学习框架
声音
2023-06-01 v1 计算机视觉与模式识别
机器学习
多媒体
音频与语音处理
摘要
准确识别、定位并分离声源的能力是任何音视觉感知任务的基础。历史上,这些能力被分别处理,针对每项任务独立开发了若干方法。然而,鉴于源定位、分离与识别的相互关联本质,独立模型可能因未能捕捉这些任务间的相互依赖而 yielding 次优性能。为解决此问题,我们提出一种统一的音视觉学习框架(称为OneAVM),其整合音频与视觉线索以联合实现定位、分离与识别。OneAVM包含一个共享的音视觉编码器和以三个目标训练的任务特定解码器。第一个目标通过局域化音视觉对应损失对齐音频与视觉表征。第二个利用传统的混合与分离框架处理视觉源分离。最后,第三个目标通过在像素空间混合图像并将其表征与所有对应声源对齐来强化视觉特征分离与定位。在MUSIC、VGG-Instruments、VGG-Music和VGGSound数据集上的大量实验证明了OneAVM对所有三项任务——音视觉源定位、分离与最近邻识别——的有效性,并实证展示了它们之间的强正迁移。
引用
@article{arxiv.2305.19458,
title = {A Unified Audio-Visual Learning Framework for Localization, Separation, and Recognition},
author = {Shentong Mo and Pedro Morgado},
journal= {arXiv preprint arXiv:2305.19458},
year = {2023}
}