中文

面向ALS患者的个性化单样本唇读

计算机视觉与模式识别 2021-11-04 v1 计算与语言

摘要

唇读,即通过说话者的口型运动视觉识别语音,是一项具有挑战性且耗费心力的任务。不幸的是,多种医疗状况迫使人们在日常生活中依赖这一技能进行基本交流。患有肌萎缩侧索硬化症(ALS)的患者通常会失去肌肉控制能力,进而丧失产生语音和通过唇部运动进行交流的能力。现有的庞大数据集并未关注医疗患者,也未针对个人整理相关的个性化词汇。然而,为训练现代数据饥渴型深度学习模型而收集患者的大规模数据集是极其困难的。在这项工作中,我们提出了一种仅使用单样本示例对ALS患者进行唇读的个性化网络。我们依赖合成生成的唇部运动来增强单样本场景。采用基于变分编码器的领域自适应技术来弥合真实与合成领域之间的差距。我们的方法显著提高了性能,为该患者实现了83.2%的前5准确率,而同类方法仅达到62.6%。除了在ALS患者身上评估我们的方法外,我们还将其扩展到严重依赖唇部运动进行交流的听力障碍人士。

关键词

引用

@article{arxiv.2111.01740,
  title  = {Personalized One-Shot Lipreading for an ALS Patient},
  author = {Bipasha Sen and Aditya Agarwal and Rudrabha Mukhopadhyay and Vinay Namboodiri and C V Jawahar},
  journal= {arXiv preprint arXiv:2111.01740},
  year   = {2021}
}