Lip2Vec:通过潜到潜视觉至音频表征映射实现高效鲁棒的视觉语音识别
声音
2023-08-14 v1 计算与语言
音频与语音处理
摘要
视觉语音识别(VSR)不同于常见的感知任务,因为它需要对视频序列进行更深层次的推理,即便对于人类专家也是如此。尽管 VSR 近期取得了进展,当前方法仍依赖标注数据来充分训练或微调其预测目标语音的模型。这阻碍了它们在训练集之外良好泛化的能力,并导致在分布外挑战性场景下性能退化。与以往涉及辅助损失或复杂训练流程及架构的工作不同,我们提出了一种基于学习先验模型的简单方法,称为 Lip2Vec。给定一个鲁棒的视觉语音编码器,该网络将唇部序列的编码潜表征映射到其对应音频对的潜表征,这些潜表征对于有效文本解码具有充分的不变性。随后生成的音频表征使用现成的音频语音识别(ASR)模型解码为文本。所提模型在 LRS3 数据集上以 26 WER 优于全监督学习方法。与 SOTA 方法不同,我们的模型在 VoxCeleb 测试集上保持了合理的性能。我们认为,将 VSR 重编程为 ASR 任务缩小了二者之间的性能差距,并为更灵活的唇读表述铺平了道路。
引用
@article{arxiv.2308.06112,
title = {Lip2Vec: Efficient and Robust Visual Speech Recognition via Latent-to-Latent Visual to Audio Representation Mapping},
author = {Yasser Abdelaziz Dahou Djilali and Sanath Narayan and Haithem Boussaid and Ebtessam Almazrouei and Merouane Debbah},
journal= {arXiv preprint arXiv:2308.06112},
year = {2023}
}