LipGen:基于唇形图像的可视语音识别
计算机视觉与模式识别
2025-01-09 v1 多媒体
摘要
视觉语音识别(VSR),即常被称为的lip reading,因其广泛的实际应用而受到关注。深度学习技术的出现以及硬件能力的提升显著增强了lip reading模型的性能。尽管如此,现有数据集主要包含稳定的视频录制, lip 动作的变异性有限。这一限制导致模型在现实场景中遇到的各种变化时高度敏感。为解决此问题,我们提出了一种新型框架LipGen,旨在通过利用语音驱动的合成视觉数据来提高模型的鲁棒性,从而缓解当前数据集的限制。此外,我们引入了一个辅助任务,将唇形类别(Viseme)分类与注意力机制相结合。这种方法促进了时间信息的有效集成,将模型的注意力引导至语音的相关片段,从而增强了判别能力。我们的方法在lip reading in the wild (LRW)数据集上 outperform 了当前的国际前沿方法,在面临挑战的情况下甚至显示出更为显著的优势。
关键词
引用
@article{arxiv.2501.04204,
title = {LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition},
author = {Bowen Hao and Dongliang Zhou and Xiaojie Li and Xingyu Zhang and Liang Xie and Jianlong Wu and Erwei Yin},
journal= {arXiv preprint arXiv:2501.04204},
year = {2025}
}
备注
This paper has been accepted for presentation at ICASSP 2025