SoundBeam 融合 M2D:基于音频基础模型的目标声提取
声音
2024-09-20 v1 音频与语音处理
摘要
目标声提取(TSE)包括使用线索从任意声音混合信号中隔离所需声音。TSE系统需要同时解决两个问题:识别目标源并从混合信号中提取目标信号。为了提高实用性,同一系统应适用于各种类型的声音。问题的二元性以及声音的多样性使得从头训练强大的TSE系统具有挑战性。在本文中,我们探索使用能够为TSE系统中各种声音提供丰富特征表示的预训练音频基础模型。我们选择使用掩码建模二元组(M2D)音频基础模型,因为它特别适合TSE任务——该模型是使用声音标签预测和改进掩码预测的双目标训练而成。这些目标与TSE的声音识别和信号提取问题相关。我们提出了一种新的TSE系统,将M2D的特征表示集成到SoundBeam中,后者是一种强大的TSE系统,可利用目标声音类别标签和预录制的enrollment(或音频查询)作为线索。我们在实验中表明,使用M2D可以提高提取性能,特别是在采用enrollment线索时效果更佳。
引用
@article{arxiv.2409.12528,
title = {SoundBeam meets M2D: Target Sound Extraction with Audio Foundation Model},
author = {Carlos Hernandez-Olivan and Marc Delcroix and Tsubasa Ochiai and Daisuke Niizumi and Naohiro Tawara and Tomohiro Nakatani and Shoko Araki},
journal= {arXiv preprint arXiv:2409.12528},
year = {2024}
}