NPU-ASLP系统描述:CNVSRC 2024视觉语音识别
计算机视觉与模式识别
2024-09-13 v3
摘要
本文阐述了NPU-ASLP(队237)在第二个中文连续视觉语音识别挑战赛(CNVSRC 2024)中介绍的视觉语音识别(VSR)系统,参与了包括固定轨道和开放轨道的四个轨道,即单说话人VSR任务和多说话人VSR任务。在数据处理方面,我们利用基线1中的lip motion提取器生成多尺度视频数据。此外,在训练期间应用了各种数据增强技术,包括速度扰动、随机旋转、水平翻转和颜色变换。在VSR模型方面,我们采用端到端架构,联合CTC/注意力损失,引入Enhanced ResNet3D视觉前端、E-Branchformer编码器和双向Transformer解码器。我们的做法在单说话人任务上实现了30.47%的错误字符率(CER),在多说话人任务上实现了34.30%的CER,夺得了单说话人任务开放轨道的第二名,以及其他三个轨道的第一名。
引用
@article{arxiv.2408.02369,
title = {The NPU-ASLP System Description for Visual Speech Recognition in CNVSRC 2024},
author = {He Wang and Lei Xie},
journal= {arXiv preprint arXiv:2408.02369},
year = {2024}
}
备注
Included in CNVSRC Workshop 2024, NCMMSC 2024