NPU-ASLP 系统在 MISP 2022 挑战赛音视觉语音识别中的方案
音频与语音处理
2023-03-14 v1
摘要
本文描述了我们的 NPU-ASLP 系统,用于多模态信息语音处理(MISP)2022 挑战赛中的音视觉日记化与识别(AVDR)任务。具体而言,首先采用加权预测误差(WPE)与引导源分离(GSS)技术来降低混响并为每个单说话人生成干净信号。随后,我们探索了基于 Branchformer 与 E-Branchformer 的 ASR 系统的有效性。为更好地利用视觉模态,提出了一种基于交叉注意力的多模态融合模块,其显式地学习不同模态间的上下文关系。实验表明,我们的系统在开发集与评测集上分别取得了 28.13\% 与 31.21\% 的拼接最小置换字符错误率(cpCER),并在该挑战赛中获第二名。
引用
@article{arxiv.2303.06341,
title = {The NPU-ASLP System for Audio-Visual Speech Recognition in MISP 2022 Challenge},
author = {Pengcheng Guo and He Wang and Bingshen Mu and Ao Zhang and Peikun Chen},
journal= {arXiv preprint arXiv:2303.06341},
year = {2023}
}
备注
2 pages, accepted by ICASSP 2023