NPU-ASLP-LiAuto系统在CNVSRC 2023视觉语音识别中的描述
音频与语音处理
2024-03-01 v2 人工智能
声音
摘要
本文阐述了NPU-ASLP-LiAuto(第237队)在首届中文连续视觉语音识别挑战赛(CNVSRC)2023中引入的视觉语音识别(VSR)系统,该系统参与了单说话人VSR任务的固定和开放赛道,以及多说话人VSR任务的开放赛道。在数据处理方面,我们利用基线1中的唇动提取器生成多尺度视频数据。此外,训练过程中应用了多种增强技术,包括速度扰动、随机旋转、水平翻转和颜色变换。VSR模型采用端到端架构,结合CTC/注意力联合损失,包含一个ResNet3D视觉前端、一个E-Branchformer编码器和一个Transformer解码器。实验表明,经过多系统融合后,我们的系统在单说话人任务上实现了34.76%的字符错误率(CER),在多说话人任务上实现了41.06%的字符错误率(CER),在我们参与的所有三个赛道中均排名第一。
引用
@article{arxiv.2401.06788,
title = {The NPU-ASLP-LiAuto System Description for Visual Speech Recognition in CNVSRC 2023},
author = {He Wang and Pengcheng Guo and Wei Chen and Pan Zhou and Lei Xie},
journal= {arXiv preprint arXiv:2401.06788},
year = {2024}
}
备注
Included in CNVSRC Workshop 2023, NCMMSC 2023