中文

面向普通话的VALLR-Pin不确定性因子化视觉语音识别

计算机视觉与模式识别 2025-12-30 v2

摘要

视觉语音识别(VSR)旨在从无声嘴部视频中转录 spoken 内容,在普通话环境下尤其具有挑战性,因为存在严重的唇音歧义和普遍的同音字。我们提出VALLR-Pin,一个两阶段的普通话VSR框架,扩展VALLR架构,显式地将拼音作为中间表示纳入。第一阶段,共享视觉编码器输入双解码器,联合预测普通话字符及其对应的拼音序列,鼓励更稳健的视觉-语言表示。在第二阶段,基于LLM的精炼模块采用预测的拼音序列及其N-best列表的字符假设,解决因同音字导致的歧义。为进一步适配LLM以处理视觉识别错误,我们在由模型生成的拼音-文本对构建的合成指令数据上进行微调,实现误差感知的纠正。在公开的普通话VSR基准测试中进行实验,结果表明VALLR-Pin在多说话人条件下持续提高转录准确率,凸显了结合音素指导与轻量级LLM精炼的有效性。

关键词

引用

@article{arxiv.2512.20032,
  title  = {VALLR-Pin: Uncertainty-Factorized Visual Speech Recognition for Mandarin with Pinyin Guidance},
  author = {Chang Sun and Dongliang Xie and Wanpeng Xie and Bo Qin and Hong Yang},
  journal= {arXiv preprint arXiv:2512.20032},
  year   = {2025}
}