中文

MMS-MSG:一种多用途多说话人混合信号生成器

音频与语音处理 2022-09-26 v1

摘要

语音增强的范畴已从单一独立任务的单一视角,转变为对复杂对话语音录音的联合处理。这些单一任务的训练与评估需要尽可能接近评估场景的、可访问中间信号的合成数据。由于此类数据通常不可用,许多工作转而使用专用数据库来训练每个系统组件,例如用于源分离的 WSJ0-mix。我们提出了一种多用途多说话人混合信号生成器(MMS-MSG),用于基于任意语音语料库生成多种语音混合信号,范围从经典无混响混合(如 WSJ0-mix)到混响混合(如 SMS-WSJ)再到会议风格数据。其高度模块化且灵活的结构允许模拟多样环境和动态混合,同时支持轻松扩展和修改以生成新场景与混合类型。这些会议可用于原型设计、评估或训练目的。我们提供了基于 WSJ 语料的会议示例评估数据与基线结果。此外,我们通过使用 MMS-MSG 为 LibriCSS 数据库提供训练数据,展示了其对真实场景的实用性。

关键词

引用

@article{arxiv.2209.11494,
  title  = {MMS-MSG: A Multi-purpose Multi-Speaker Mixture Signal Generator},
  author = {Tobias Cord-Landwehr and Thilo von Neumann and Christoph Boeddeker and Reinhold Haeb-Umbach},
  journal= {arXiv preprint arXiv:2209.11494},
  year   = {2022}
}

备注

Accepted at IWAENC 2022