基于独立向量分析的端到端多说话人语音识别
音频与语音处理
2022-04-04 v1 计算与语言
声音
摘要
我们开发了一个用于多通道多说话人自动语音识别的端到端系统。我们提出了一种基于独立向量分析(IVA)范式的联合源分离与去混响前端。它采用快速稳定的迭代源导向算法与神经源模型。ASR模块与神经源模型的参数由ASR损失本身联合优化。我们展示了与先前采用神经波束成形前端的系统相媲美的性能。首先,我们探究了训练与测试使用不同通道数时的权衡。其次,我们证明所提IVA前端在噪声数据上表现良好,即便仅以干净混合训练。此外,它无需重训练即可扩展到更多说话人的分离,这在三人与四人说话人混合上得到验证。
引用
@article{arxiv.2204.00218,
title = {End-to-End Multi-speaker ASR with Independent Vector Analysis},
author = {Robin Scheibler and Wangyou Zhang and Xuankai Chang and Shinji Watanabe and Yanmin Qian},
journal= {arXiv preprint arXiv:2204.00218},
year = {2022}
}
备注
Submitted to INTERSPEECH2022. 5 pages, 2 figures, 3 tables