中文

面向 CHiME-5 挑战赛的改进说话人相关分离

音频与语音处理 2019-04-09 v1 声音

摘要

本文总结了为改进我们提交的 NWPU 说话人相关系统用于 CHiME-5 挑战赛的若干后续贡献,该挑战赛旨在解决晚宴场景中具有混响和非平稳噪声的多通道、高度重叠会话语音识别问题。我们采用说话人感知训练方法,利用 i-vector 作为目标说话人信息进行多说话人语音分离。仅使用对所有说话人统一的一个分离模型,借助我们新提出的数据处理技术与波束成形方法,我们在开发集上相对于先前 80.28% 的基线取得了词错误率(WER)绝对提升 10%。通过我们改进的后端声学模型,我们进一步将 WER 降至 60.15%,超越了所提交 CHiME-5 挑战赛系统的结果,且未采用任何融合技术。

关键词

引用

@article{arxiv.1904.03792,
  title  = {Improved Speaker-Dependent Separation for CHiME-5 Challenge},
  author = {Jian Wu and Yong Xu and Shi-Xiong Zhang and Lian-Wu Chen and Meng Yu and Lei Xie and Dong Yu},
  journal= {arXiv preprint arXiv:1904.03792},
  year   = {2019}
}

备注

Submitted to Interspeech 2019, Graz, Austria