提升现实场景下语音分离泛化能力:模拟、优化与评估的策略
声音
2024-08-30 v1 人工智能
机器学习
音频与语音处理
摘要
在具有噪声和混响的各种声学环境中实现对重叠说话人语音的鲁健分离仍是开放挑战。虽然已有数据集可用于针对特定场景训练分离器,但它们在跨越多样化现实场景方面并不有效。本文提出了一套新型数据模拟管道,从广泛的声学环境和内容中产生多样化训练数据,并提出了新的训练范式以提高泛化语音分离模型的质量。具体而言,我们首先引入 AC-SIM,一种包含内容和声学广泛变异的数据模拟管道。随后,我们将多个训练目标整合到置换不变训练(PIT)中,以增强分离质量和所训练模型的泛化能力。最后,我们在分离架构和基准测试上进行全面的客观和人类听觉实验,以验证我们的方法,显示出在非同质和真实世界测试集上的显著泛化提升。
引用
@article{arxiv.2408.16126,
title = {Improving Generalization of Speech Separation in Real-World Scenarios: Strategies in Simulation, Optimization, and Evaluation},
author = {Ke Chen and Jiaqi Su and Taylor Berg-Kirkpatrick and Shlomo Dubnov and Zeyu Jin},
journal= {arXiv preprint arXiv:2408.16126},
year = {2024}
}
备注
In Proceedings of the 25th Annual Conference of the International Speech Communication Association, Interspeech 2024