中文

基于语义引导跨表征对齐的无级联普通话视觉语音识别

计算机视觉与模式识别 2026-03-24 v1

摘要

中文普通话视觉语音识别(VSR)是一项近年来取得进展的任务,但其性能仍落后于英语等非声调语言。一个主要挑战源于普通话的声调特性,这限制了传统序列到序列建模方法的有效性。为缓解这一问题,现有的中文VSR系统通常在级联架构中引入中间表征,尤其是拼音,以提高识别准确率。尽管有所裨益,但在这些级联设计中,推理过程中的后续阶段依赖于前一阶段的输出,导致误差累积和推理延迟增加。为解决这些局限,我们提出了一种基于多任务学习的无级联架构,该架构联合整合了包括音素和视素在内的多种中间表征,以更好地利用上下文信息。所提出的语义引导局部对比损失在时间上对齐特征,使得在推理时能够按需激活,从而在推理效率和性能之间取得权衡,同时减轻由投影和重嵌入引起的误差累积。在公开数据集上进行的实验表明,我们的方法取得了优越的识别性能。

关键词

引用

@article{arxiv.2603.21808,
  title  = {Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment},
  author = {Lei Yang and Yi He and Fei Wu and Shilin Wang},
  journal= {arXiv preprint arXiv:2603.21808},
  year   = {2026}
}