中文

SMS-WSJ:用于多通道源分离与识别的数据库、性能度量及基线方案

声音 2019-10-31 v1 计算与语言 音频与语音处理

摘要

我们提出一个用于训练、评估及详细分析源分离与提取算法的重叠语音多通道数据库:SMS-WSJ——空间化多说话人华尔街日报(Spatialized Multi-Speaker Wall Street Journal)。其由取自WSJ数据库的 artificially mixed speech 组成,但不同于早期数据库,我们考虑所有WSJ0+1语句,并严格分离训练、验证和测试集中出现的说话人集合。在空间化数据时,我们确保关于房间尺寸、阵列中心与旋转以及说话人位置的高度随机性。此外,本文对近期提出的源分离性能度量进行了批判性评估。除生成数据库的代码外,我们提供一个源分离基线和具有具竞争力词错误率的Kaldi方案,以提供评估的共同基础。

关键词

引用

@article{arxiv.1910.13934,
  title  = {SMS-WSJ: Database, performance measures, and baseline recipe for multi-channel source separation and recognition},
  author = {Lukas Drude and Jens Heitkaemper and Christoph Boeddeker and Reinhold Haeb-Umbach},
  journal= {arXiv preprint arXiv:1910.13934},
  year   = {2019}
}

备注

Submitted to ICASSP 2020