利用混合不变训练使语音分离适应真实会议场景
声音
2021-10-22 v1 音频与语音处理
摘要
最近提出的混合不变训练(MixIT)是一种用于训练单通道声音分离模型的无监督方法,即它不需要真实孤立参考源。在本文中,我们研究使用 MixIT 在来自 AMI 语料库的真实远场重叠混响含噪语音数据上自适应一个分离模型。这些模型在包含重叠语音的真实 AMI 录音上进行测试,并由人类听者进行主观评价。为客观评价我们的模型,我们还设计了一个合成 AMI 测试集。对于真实录音上的人类评价,我们还提出了一种标准 MUSHRA 协议的修改版以处理不完美参考信号,称之为 MUSHIRA。在保持网络架构不变的情况下,我们发现一个微调的半监督模型在合成与真实数据集上均产生了最大的 SI-SNR 提升、PESQ 分数和人类听评评分,优于在数量级更多数据上训练的非自适应通用模型。我们的结果表明,通过 MixIT 的无监督学习能够实现在真实世界无标签自发语音录音上的模型自适应。
引用
@article{arxiv.2110.10739,
title = {Adapting Speech Separation to Real-World Meetings Using Mixture Invariant Training},
author = {Aswin Sivaraman and Scott Wisdom and Hakan Erdogan and John R. Hershey},
journal= {arXiv preprint arXiv:2110.10739},
year = {2021}
}