面向视觉语音识别的信息同步时序卷积网络
计算机视觉与模式识别
2025-08-05 v1
摘要
从静默视频中估计 spoken content 对 Assistive Technology (AT) 和 Augmented Reality (AR) 的应用至关重要。然而,将 lip movement序列准确映射到单词存在显著挑战,由于序列之间的变异性以及每个序列中信息分布的不均。为此,我们引入 InfoSyncNet,这是一个增强数据增强技术的非均匀序列建模网络。InfoSyncNet 的核心是编码器和解码器之间的位置非均匀量化模块,使网络能够动态调整其关注力度,有效处理视觉语音数据中自然的不一致性。此外,还Incorporated了多种训练策略来增强模型处理光照变化和说话者姿态变化的能力。在 LRW 和 LRW1000 数据集上的全面实验确认了 InfoSyncNet 的优势,实现了 92.0% 和 60.7% 的 Top-1 ACC 新纪录。该代码可供下载(见注释)。
引用
@article{arxiv.2508.02460,
title = {InfoSyncNet: Information Synchronization Temporal Convolutional Network for Visual Speech Recognition},
author = {Junxiao Xue and Xiaozhen Liu and Xuecheng Wu and Fei Yu and Jun Wang},
journal= {arXiv preprint arXiv:2508.02460},
year = {2025}
}
备注
https://github.com/liuxiaozhen123/InfoSyncNet