音频源分离中神经架构的泛化挑战
声音
2018-05-29 v2 机器学习
信号处理
摘要
最近的工作表明,可以训练循环神经网络以高保真度分离声音混合物中的各个说话者。在此,我们探索卷积神经网络模型作为替代方案,并表明它们以少一个数量级的参数实现了 SOTA 结果。我们还表征并比较了这些不同方法在三种不同测试条件下的鲁棒性和泛化能力:更长的时间序列、间歇性噪声的添加以及训练期间未见过的不同数据集。对于最后一种条件,我们创建了一个新数据集 RealTalkLibri,以在真实环境中测试源分离。我们表明,环境的声学特性对波形结构和神经网络模型的整体性能有显著影响,其中卷积模型在泛化到新环境方面表现出优越的能力。我们的研究代码可在 https://github.com/ShariqM/source_separation 获取。
引用
@article{arxiv.1803.08629,
title = {Generalization Challenges for Neural Architectures in Audio Source Separation},
author = {Shariq Mobin and Brian Cheung and Bruno Olshausen},
journal= {arXiv preprint arXiv:1803.08629},
year = {2018}
}