AKVSR:通过压缩预训练模型音频知识赋能的视觉语音识别
计算机视觉与模式识别
2024-01-15 v2 多媒体
音频与语音处理
图像与视频处理
摘要
视觉语音识别(VSR)是从无声唇部运动中预测 spoken words 的任务。由于唇部运动信息不足,VSR 被认为是一项具有挑战性的任务。本文提出一种音频知识赋能的视觉语音识别框架(AKVSR),利用音频模态补充视觉模态中不足的语音信息。与先前方法不同,所提 AKVSR 1)利用大规模预训练音频模型编码的丰富音频知识,2)通过量化丢弃音频中的非语言信息,将音频知识的语言信息保存在紧凑音频记忆中,3)包含音频桥接模块,可从紧凑音频记忆中查找最佳匹配音频特征,这使得一旦紧凑音频记忆构建完成,无需音频输入即可进行训练。我们通过大量实验验证了所提方法的有效性,并在广泛使用的 LRS3 数据集上取得了新的最先进性能。
引用
@article{arxiv.2308.07593,
title = {AKVSR: Audio Knowledge Empowered Visual Speech Recognition by Compressing Audio Knowledge of a Pretrained Model},
author = {Jeong Hun Yeo and Minsu Kim and Jeongsoo Choi and Dae Hoe Kim and Yong Man Ro},
journal= {arXiv preprint arXiv:2308.07593},
year = {2024}
}
备注
Accepted by IEEE Transactions on Multimedia