中文

GLip:面向鲁健视觉语音识别的全局-局部集成渐进框架

计算机视觉与模式识别 2025-09-29 v2

摘要

视觉语音识别(VSR),也称为唇读,是从静默视频中识别语音的任务。尽管近几十年来VSR取得了显著进展,但大多数现有方法仅关注实世界视觉挑战,如光照变化、遮挡、模糊和姿态变化。为解决这些挑战,我们提出了GLip,一个面向鲁健VSR的全局-局部集成渐进框架。GLip基于两个关键观察:(i)学习视觉特征在不同条件下的初始粗糙对齐及其对应的语音内容,有助于后续在挑战环境中学习精确的视觉到语音映射;(ii)在不利条件下,某些局部区域(例如非遮挡区域)往往比全局特征在唇读中更具辨识度。为此,GLip引入了双路径特征提取架构,在两个阶段的渐进学习框架中集成全局和局部特征。在第一个阶段,模型学习将全局和局部视觉特征与相应的语音单元对齐,使用易获得的音视频数据,建立粗糙但语义上稳健的基础。在第二个阶段,我们引入了语境增强模块(CEM),动态地在空间和时间维度上整合局部特征与相关的全局上下文,将粗糙的表征细化为精确的视觉-语音映射。我们的框架通过渐进学习策略利用判别性强的局部区域,显示出对各种视觉挑战具有更好的鲁健性,并在LRS2和LRS3基准测试中持续优于现有方法。我们进一步在一个新引入的具有挑战性的中文数据集上验证了其有效性。

关键词

引用

@article{arxiv.2509.16031,
  title  = {GLip: A Global-Local Integrated Progressive Framework for Robust Visual Speech Recognition},
  author = {Tianyue Wang and Shuang Yang and Shiguang Shan and Xilin Chen},
  journal= {arXiv preprint arXiv:2509.16031},
  year   = {2025}
}