用于视觉语音识别的多时序唇-音频记忆
计算机视觉与模式识别
2023-05-09 v1 音频与语音处理
摘要
视觉语音识别 (VSR) 是一项从唇部运动预测句子或单词的任务。近期已有一些利用音频信号补充视觉信息的工作。然而,现有方法仅利用有限信息,如音素级特征和自动语音识别 (ASR) 网络的软标签。本文提出一种多时序唇-音频记忆 (MTLAM),充分利用音频信号以补充唇部运动信息的不足。所提方法主要由两部分组成:1) MTLAM 保存由短时序与长时序音频信号产生的多时序音频特征,并记忆视觉到音频的映射,以在推理阶段从视觉特征加载存储的多时序音频特征。2) 我们设计了一种音频时序模型,以产生捕捉邻近词上下文的多时序音频特征。此外,为构建有效的视觉到音频映射,音频时序模型可生成与视觉特征时间对齐的音频特征。通过大量实验,我们验证了 MTLAM 在两个公开 VSR 数据集上取得最先进性能的有效性。
引用
@article{arxiv.2305.04542,
title = {Multi-Temporal Lip-Audio Memory for Visual Speech Recognition},
author = {Jeong Hun Yeo and Minsu Kim and Yong Man Ro},
journal= {arXiv preprint arXiv:2305.04542},
year = {2023}
}
备注
Presented at ICASSP 2023