基于混合专家模型的鲁棒性声学视觉语音识别
音频与语音处理
2024-09-20 v1 计算与语言
计算机视觉与模式识别
声音
摘要
视觉信号通过提供额外的上下文信息可提高声学视觉语音识别的准确率。鉴于视觉信号的复杂性,声学视觉语音识别模型需要具备跨 diverse video 场景的鲁棒性,这是一项重大挑战。本文介绍了 EVA 模型,利用混合专家技术实现 audioVisual ASR,以对 ``野外'' 视频进行稳健语音识别。具体而言,我们首先将视觉信息编码为视觉标记序列,并通过轻量级投影映射到语音空间。随后,我们基于已训练的稳健语音识别模型构建 EVA,以确保其泛化能力。此外,为有效融合视觉信息,我们通过混合专家模块将视觉信息注入 ASR 模型。实验结果表明,我们的模型在三个基准数据集上实现了最先进的成绩,展示了 EVA 在多样化视频领域的泛化能力。
引用
@article{arxiv.2409.12370,
title = {Robust Audiovisual Speech Recognition Models with Mixture-of-Experts},
author = {Yihan Wu and Yifan Peng and Yichen Lu and Xuankai Chang and Ruihua Song and Shinji Watanabe},
journal= {arXiv preprint arXiv:2409.12370},
year = {2024}
}
备注
6 pages, 2 figures, accepted by IEEE Spoken Language Technology Workshop 2024