中文

基于深度神经网络与移动应用前端的实用唇语转语音转换系统

计算机视觉与模式识别 2021-04-30 v1

摘要

发音到声学(正向)映射是一种利用各种发音采集技术作为输入(例如超声舌成像、MRI、唇部视频)来预测语音的技术。唇部视频的优势在于易获取且成本低:大多数现代智能手机都配有前置摄像头。已有若干唇语转语音合成方案,但它们大多集中于离线训练与推理。本文中,我们提出了一个由用于深度神经网络训练与推理的后端以及以移动应用形式呈现的前端所构成的系统。我们的初步评估表明该场景可行:74%的top-5分类准确率与移动应用用户的反馈相结合,确保言语障碍者有可能通过该方案进行交流。

关键词

引用

@article{arxiv.2104.14467,
  title  = {Towards a practical lip-to-speech conversion system using deep neural networks and mobile application frontend},
  author = {Frigyes Viktor Arthur and Tamás Gábor Csapó},
  journal= {arXiv preprint arXiv:2104.14467},
  year   = {2021}
}

备注

10 pages, 6 figures