中文

用于 CNVSRC Challenge 2023 的 GUA-Speech 系统描述

计算与语言 2023-12-13 v1

摘要

本研究描述了我们用于中文连续视觉语音识别挑战赛(CNVSRC)2023 任务 1 单说话人视觉语音识别(VSR)固定赛道的系统。具体而言,我们使用中间连接时序分类残差模块来放宽模型中 CTC 的条件独立假设。然后我们使用双 Transformer 解码器,使模型能够同时捕获过去和未来的上下文信息。此外,我们使用汉字作为建模单元以提高模型的识别准确率。最后,我们在推理阶段使用循环神经网络语言模型(RNNLM)进行浅层融合。实验表明,我们的系统在 Eval 集上实现了 38.09% 的字符错误率(CER),相较于官方基线实现了 21.63% 的相对 CER 降低,并在挑战赛中获得第二名。

关键词

引用

@article{arxiv.2312.07254,
  title  = {The GUA-Speech System Description for CNVSRC Challenge 2023},
  author = {Shengqiang Li and Chao Lei and Baozhong Ma and Binbin Zhang and Fuping Pan},
  journal= {arXiv preprint arXiv:2312.07254},
  year   = {2023}
}

备注

CNVSRC 2023 Challenge