中文

基于独立向量分析的端到端多说话人语音识别

音频与语音处理 2022-04-04 v1 计算与语言 声音

摘要

我们开发了一个用于多通道多说话人自动语音识别的端到端系统。我们提出了一种基于独立向量分析(IVA)范式的联合源分离与去混响前端。它采用快速稳定的迭代源导向算法与神经源模型。ASR模块与神经源模型的参数由ASR损失本身联合优化。我们展示了与先前采用神经波束成形前端的系统相媲美的性能。首先,我们探究了训练与测试使用不同通道数时的权衡。其次,我们证明所提IVA前端在噪声数据上表现良好,即便仅以干净混合训练。此外,它无需重训练即可扩展到更多说话人的分离,这在三人与四人说话人混合上得到验证。

关键词

引用

@article{arxiv.2204.00218,
  title  = {End-to-End Multi-speaker ASR with Independent Vector Analysis},
  author = {Robin Scheibler and Wangyou Zhang and Xuankai Chang and Shinji Watanabe and Yanmin Qian},
  journal= {arXiv preprint arXiv:2204.00218},
  year   = {2022}
}

备注

Submitted to INTERSPEECH2022. 5 pages, 2 figures, 3 tables