面向 CHiME-5 挑战赛的改进说话人相关分离
音频与语音处理
2019-04-09 v1 声音
摘要
本文总结了为改进我们提交的 NWPU 说话人相关系统用于 CHiME-5 挑战赛的若干后续贡献,该挑战赛旨在解决晚宴场景中具有混响和非平稳噪声的多通道、高度重叠会话语音识别问题。我们采用说话人感知训练方法,利用 i-vector 作为目标说话人信息进行多说话人语音分离。仅使用对所有说话人统一的一个分离模型,借助我们新提出的数据处理技术与波束成形方法,我们在开发集上相对于先前 80.28% 的基线取得了词错误率(WER)绝对提升 10%。通过我们改进的后端声学模型,我们进一步将 WER 降至 60.15%,超越了所提交 CHiME-5 挑战赛系统的结果,且未采用任何融合技术。
引用
@article{arxiv.1904.03792,
title = {Improved Speaker-Dependent Separation for CHiME-5 Challenge},
author = {Jian Wu and Yong Xu and Shi-Xiong Zhang and Lian-Wu Chen and Meng Yu and Lei Xie and Dong Yu},
journal= {arXiv preprint arXiv:1904.03792},
year = {2019}
}
备注
Submitted to Interspeech 2019, Graz, Austria