中文

基于空间混合模型的会议分离初始化方案

声音 2022-04-05 v1 音频与语音处理

摘要

支持空间混合模型 (SMM) 的声学波束成形已广泛用于同时活跃说话人的分离。然而,它很少被考虑用于会议数据的分离,这类数据的特点是录音长且语音仅部分重叠。在本文中,我们展示了经常仅单个说话人活跃这一事实可用于对采用时变类先验的 SMM 进行巧妙初始化。在 LibriCSS 上的实验表明,所提初始化方案在下游语音识别任务上比通过从 Dirichlet 分布抽取来随机初始化类概率取得了显著更低的词错误率 (WER)。在仅需已知说话人数量的条件下,我们得到 5.9% 的 WER,与该数据集上报道的最佳 WER 相当。此外,混合模型估计的说话人活跃度可用作基于空间信息的说话人日志。

关键词

引用

@article{arxiv.2204.01338,
  title  = {An Initialization Scheme for Meeting Separation with Spatial Mixture Models},
  author = {Christoph Boeddeker and Tobias Cord-Landwehr and Thilo von Neumann and Reinhold Haeb-Umbach},
  journal= {arXiv preprint arXiv:2204.01338},
  year   = {2022}
}

备注

Submitted to INTERSPEECH 2022