WHAM!:将语音分离拓展至含噪环境
声音
2019-07-03 v1 计算与语言
机器学习
音频与语音处理
机器学习
摘要
近期在利用单音频通道从多个重叠说话人中分离语音信号方面的进展,使我们更接近于解决鸡尾酒会问题。然而,该领域多数研究采用受限的问题设定,在说话人几乎完全重叠、人为低采样率且无外部背景噪声下比较性能。在本文中,我们力求推动该领域走向更真实且更具挑战性的场景。为此,我们创建了 WSJ0 Hipster Ambient Mixtures(WHAM!)数据集,由 wsj0-2mix 数据集中的双说话人混合配以真实环境噪声样本构成。样本采集于旧金山湾区的咖啡馆、餐厅与酒吧,并已公开可用。我们对多种语音分离架构与目标函数进行基准测试,以评估其对噪声的鲁棒性。尽管分离性能因噪声而下降,我们对多数方法仍观察到相对于含噪信号的显著增益。
引用
@article{arxiv.1907.01160,
title = {WHAM!: Extending Speech Separation to Noisy Environments},
author = {Gordon Wichern and Joe Antognini and Michael Flynn and Licheng Richard Zhu and Emmett McQuinn and Dwight Crow and Ethan Manilow and Jonathan Le Roux},
journal= {arXiv preprint arXiv:1907.01160},
year = {2019}
}
备注
Accepted for publication at Interspeech 2019