中文

Lip-Listening:利用跨模态知识蒸馏混合感官理解基于词的模型中的嘴唇

多媒体 2022-07-13 v1 计算与语言 声音 音频与语音处理

摘要

在本工作中,我们提出一种将语音识别能力从音频语音识别系统迁移到视觉语音识别器的方法,其目标是在唇读模型训练期间利用音频数据。音频和音视频系统在语音识别领域已取得令人印象深刻的进展。然而,由于某些音素的视觉模糊性,视觉语音识别系统仍有许多待探索之处。为此,鉴于音频模型的不稳定性,开发视觉语音识别模型至关重要。本工作的主要贡献为:i) 在近期最先进的基于词的唇读模型基础上,将序列级和帧级知识蒸馏(KD)集成到其系统中;ii) 在训练视觉模型时利用音频数据,这一做法在先前基于词的工作中未被使用;iii) 提出帧级KD中的高斯形平均,作为一种高效技术,帮助模型在序列模型编码器处蒸馏知识。本工作提出了一种新颖且具竞争力的唇读架构,因为我们展示了性能的显著提升,在LRW数据集上设定了等于88.64%的新基准。

关键词

引用

@article{arxiv.2207.05692,
  title  = {Lip-Listening: Mixing Senses to Understand Lips using Cross Modality Knowledge Distillation for Word-Based Models},
  author = {Hadeel Mabrouk and Omar Abugabal and Nourhan Sakr and Hesham M. Eraqi},
  journal= {arXiv preprint arXiv:2207.05692},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:2108.03543