基于说话人库存的长时多说话人录音连续语音分离
音频与语音处理
2020-12-21 v2 声音
信号处理
摘要
利用额外说话人信息以促进语音分离近年来受到越来越多的关注。近期研究包括使用目标说话人的语音片段提取目标语音,以及使用一组额外说话人信号联合分离所有参与说话人,后者被称为基于说话人库存的语音分离(SSUSI)。然而,这些系统均理想化地假设预注册的说话人信号可用,且仅在简单数据配置下评估。在真实的多说话人对话中,语音信号含有大量非重叠区域,从中可导出个体说话人的鲁棒说话人嵌入。本工作中,我们在长时录音中采用 SSUSI 模型,并提出一种用于长时录音的、基于自信息聚类的库存构建方案,其中说话人库存完全由输入信号构建,无需外部说话人信号。在模拟的含噪混响长时录音数据集上的实验结果表明,所提方法能在各种条件下显著提升分离性能。
引用
@article{arxiv.2012.09727,
title = {Continuous Speech Separation Using Speaker Inventory for Long Multi-talker Recording},
author = {Cong Han and Yi Luo and Chenda Li and Tianyan Zhou and Keisuke Kinoshita and Shinji Watanabe and Marc Delcroix and Hakan Erdogan and John R. Hershey and Nima Mesgarani and Zhuo Chen},
journal= {arXiv preprint arXiv:2012.09727},
year = {2020}
}