PixIT:基于真实世界多说话人录音的说话人日志与语音分离联合训练
音频与语音处理
2024-11-22 v2
摘要
监督式语音分离(SSep)系统的一个主要缺陷是依赖合成数据,导致在真实世界中泛化能力差。混合不变训练(MixIT)被提出作为一种使用真实录音的无监督替代方案,但在过度分离和适应长音频方面存在困难。我们引入了 PixIT,这是一种联合方法,结合了用于说话人日志(SD)的置换不变训练(PIT)和用于 SSep 的 MixIT。仅需少量额外的 SD 标签需求,它便解决了过度分离问题,并允许利用基于聚类的神经 SD 的现有工作来拼接局部分离的声源。我们通过将自动语音识别(ASR)系统应用于分离出的声源来测量其质量。PixIT 在两个会议语料库上提升了各种 ASR 系统的性能,无论是在说话人属性还是话语级别的词错误率方面均有提升,且无需任何微调。
引用
@article{arxiv.2403.02288,
title = {PixIT: Joint Training of Speaker Diarization and Speech Separation from Real-world Multi-speaker Recordings},
author = {Joonas Kalda and Clément Pagés and Ricard Marxer and Tanel Alumäe and Hervé Bredin},
journal= {arXiv preprint arXiv:2403.02288},
year = {2024}
}
备注
Speaker Odyssey 2024