面向唇读MOOCs:利用合成说话头大规模训练人类唇读能力
计算机视觉与模式识别
2022-10-07 v2 计算机与社会
摘要
许多有一定程度听力损失的人将唇读视为日常交流的主要方式。然而,寻找学习或提升唇读技能的资源可能具有挑战性。在COVID19大流行中,由于限制与同伴和言语治疗师的 direct 互动,这一问题进一步加剧。如今,Coursera和Udemy等在线MOOC平台已成为许多类型技能发展中最有效的培训形式。然而,在线唇读资源稀缺,因为创建此类资源是一个需要数月人工努力来录制雇佣演员的广泛过程。由于人工流程,此类平台在词汇量、支持语言、口音和说话人方面也受限,且使用成本高。在这项工作中,我们研究以合成生成视频替代真实人类说话视频的可能性。合成数据可轻松纳入更大词汇量、口音变化甚至本地语言和众多说话人。我们提出一个端到端自动化流程,使用最先进的说话头视频生成器网络、文本转语音模型和计算机视觉技术来开发此类平台。然后,我们使用精心设计的唇读练习进行广泛的人类评估,以针对现有唇读平台验证我们所设计平台的质量。我们的研究具体指向了我们的方法在开发可影响数百万听力损失人群的大规模唇读MOOC平台方面的潜力。
引用
@article{arxiv.2208.09796,
title = {Towards MOOCs for Lipreading: Using Synthetic Talking Heads to Train Humans in Lipreading at Scale},
author = {Aditya Agarwal and Bipasha Sen and Rudrabha Mukhopadhyay and Vinay Namboodiri and C. V Jawahar},
journal= {arXiv preprint arXiv:2208.09796},
year = {2022}
}
备注
Accepted at WACV 2023