中文

用于自动唇读系统与迁移学习的多模态德语数据集

计算机视觉与模式识别 2022-07-12 v3 计算与语言 机器学习

摘要

深度唇读学习所需的大型数据集在许多语言中并不存在。本文提出数据集 GLips(German Lips),包含 250,000 个公开可用的黑森州议会发言人脸部视频,经自动流水线处理用于词级唇读。其格式类似于英语 LRW(Lip Reading in the Wild)数据集,每个视频在 1.16 秒时长上下文中编码一个感兴趣单词,从而便于研究两数据集间的迁移学习。通过训练深度神经网络,我们探究唇读是否具有语言无关特征,以使不同语言的数据集可用于改进唇读模型。我们展示了从零开始的学习,并表明从 LRW 到 GLips 及反向的迁移学习提升了学习速度与性能,尤其在验证集上。

关键词

引用

@article{arxiv.2202.13403,
  title  = {A Multimodal German Dataset for Automatic Lip Reading Systems and Transfer Learning},
  author = {Gerald Schwiebert and Cornelius Weber and Leyuan Qu and Henrique Siqueira and Stefan Wermter},
  journal= {arXiv preprint arXiv:2202.13403},
  year   = {2022}
}

备注

Accepted to LREC 2022