中文

心智差距:合成对话数据对多说话人语音识别与说话人分割的影响

音频与语音处理 2026-05-18 v1

摘要

近期在多说话人语音识别 (MT-ASR) 和说话人分割 (SD) 方面的突破依赖于合成数据来缓解大规模对话录音资料稀缺的问题,但具体仿真选择的影响仍不为人知。为弥补模拟混合物与真实世界互动之间的差距,我们present了一项关于 MT-ASR (DiCoW) 和 SD (Sortformer) 系统的合成数据生成研究。通过引入 FastMSS,一款高度高效的开源模拟器,我们分析了轮次动态、源域、声学增强和数据混合策略。我们的发现表明,最佳仿真配方高度依赖于具体任务:增加语音重叠有助于 ASR 但会损害分割。此外,广泛的源域多样性始终优于精确的域匹配。最终,仅使用合成数据的训练方法可达到真实数据的基准水平,而将合成数据与真实录音组合训练在两项任务中均显著优于仅使用真实数据训练。

关键词

引用

@article{arxiv.2605.15442,
  title  = {Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization},
  author = {Alexander Polok and Ivan Medennikov and Jan Černocký and Shinji Watanabe and Lukáš Burget and Samuele Cornell},
  journal= {arXiv preprint arXiv:2605.15442},
  year   = {2026}
}

备注

Submitted to INTERSPEECH 2026