中文

AKVSR:通过压缩预训练模型音频知识赋能的视觉语音识别

计算机视觉与模式识别 2024-01-15 v2 多媒体 音频与语音处理 图像与视频处理

摘要

视觉语音识别(VSR)是从无声唇部运动中预测 spoken words 的任务。由于唇部运动信息不足,VSR 被认为是一项具有挑战性的任务。本文提出一种音频知识赋能的视觉语音识别框架(AKVSR),利用音频模态补充视觉模态中不足的语音信息。与先前方法不同,所提 AKVSR 1)利用大规模预训练音频模型编码的丰富音频知识,2)通过量化丢弃音频中的非语言信息,将音频知识的语言信息保存在紧凑音频记忆中,3)包含音频桥接模块,可从紧凑音频记忆中查找最佳匹配音频特征,这使得一旦紧凑音频记忆构建完成,无需音频输入即可进行训练。我们通过大量实验验证了所提方法的有效性,并在广泛使用的 LRS3 数据集上取得了新的最先进性能。

关键词

引用

@article{arxiv.2308.07593,
  title  = {AKVSR: Audio Knowledge Empowered Visual Speech Recognition by Compressing Audio Knowledge of a Pretrained Model},
  author = {Jeong Hun Yeo and Minsu Kim and Jeongsoo Choi and Dae Hoe Kim and Yong Man Ro},
  journal= {arXiv preprint arXiv:2308.07593},
  year   = {2024}
}

备注

Accepted by IEEE Transactions on Multimedia