中文

Lip2Vec:通过潜到潜视觉至音频表征映射实现高效鲁棒的视觉语音识别

声音 2023-08-14 v1 计算与语言 音频与语音处理

摘要

视觉语音识别(VSR)不同于常见的感知任务,因为它需要对视频序列进行更深层次的推理,即便对于人类专家也是如此。尽管 VSR 近期取得了进展,当前方法仍依赖标注数据来充分训练或微调其预测目标语音的模型。这阻碍了它们在训练集之外良好泛化的能力,并导致在分布外挑战性场景下性能退化。与以往涉及辅助损失或复杂训练流程及架构的工作不同,我们提出了一种基于学习先验模型的简单方法,称为 Lip2Vec。给定一个鲁棒的视觉语音编码器,该网络将唇部序列的编码潜表征映射到其对应音频对的潜表征,这些潜表征对于有效文本解码具有充分的不变性。随后生成的音频表征使用现成的音频语音识别(ASR)模型解码为文本。所提模型在 LRS3 数据集上以 26 WER 优于全监督学习方法。与 SOTA 方法不同,我们的模型在 VoxCeleb 测试集上保持了合理的性能。我们认为,将 VSR 重编程为 ASR 任务缩小了二者之间的性能差距,并为更灵活的唇读表述铺平了道路。

关键词

引用

@article{arxiv.2308.06112,
  title  = {Lip2Vec: Efficient and Robust Visual Speech Recognition via Latent-to-Latent Visual to Audio Representation Mapping},
  author = {Yasser Abdelaziz Dahou Djilali and Sanath Narayan and Haithem Boussaid and Ebtessam Almazrouei and Merouane Debbah},
  journal= {arXiv preprint arXiv:2308.06112},
  year   = {2023}
}