中文

真实失配条件下的分离引导说话人日记化

音频与语音处理 2021-07-07 v1 声音

摘要

我们通过充分利用语音分离与说话人聚类的互补性,提出了一种分离引导说话人日记化(SGSD)方法。由于传统的基于聚类的说话人日记化(CSD)方法不能很好地处理重叠语音段,我们在本研究中考察了基于分离的说话人日记化(SSD),其本质上具有处理说话人重叠区域的潜力。我们的初步分析表明,最先进的基于 Conv-TasNet 的语音分离在仿真数据上表现相当好,但由于模拟训练语音与朗读语音间高度失配的说话风格,在真实对话语音中不稳定。在此过程中,基于分离的处理可在真实失配条件下协助 CSD 处理重叠语音段。具体而言,我们设计了若干策略,基于 SSD 系统性能的不稳定性分析,在 SSD 与 CSD 系统结果间进行选择。在来自 DIHARD-III 挑战赛的对话电话语音(CTS)数据上的实验表明,所提出的 SGSD 系统能显著改善最先进 CSD 系统的性能,在开发集与评估集上分别取得 20.2% 与 20.8% 的相对日记化错误率降低。

关键词

引用

@article{arxiv.2107.02357,
  title  = {Separation Guided Speaker Diarization in Realistic Mismatched Conditions},
  author = {Shu-Tong Niu and Jun Du and Lei Sun and Chin-Hui Lee},
  journal= {arXiv preprint arXiv:2107.02357},
  year   = {2021}
}