中文

视觉语音识别

计算机视觉与模式识别 2014-09-05 v1

摘要

唇读用于在不听到声音的情况下理解或解释言语,这是一种尤其被听力障碍者掌握的技术。唇读能力使听力受损者能够与他人交流并参与社交活动,否则这将很困难。计算机视觉、模式识别和信号处理领域的最新进展使得人们对自动化这一具有挑战性的唇读任务越来越感兴趣。实际上,自动化人类的唇读能力(称为视觉语音识别(VSR),有时也称为言语阅读)可以为其他新颖的相关应用打开大门。在过去十年中,VSR因其在诸如人机交互(HCI)、视听语音识别(AVSR)、说话人识别、虚拟说话人、手语识别和视频监控等应用中的潜在用途而受到广泛关注。其主要目标是通过仅使用言语过程中产生的视觉信号来识别口语单词。因此,VSR涉及言语的视觉领域,并包括图像处理、人工智能、目标检测、模式识别、统计建模等。

关键词

引用

@article{arxiv.1409.1411,
  title  = {Visual Speech Recognition},
  author = {Ahmad B. A. Hassanat},
  journal= {arXiv preprint arXiv:1409.1411},
  year   = {2014}
}

备注

Speech and Language Technologies (Book), Prof. Ivo Ipsic (Ed.), ISBN: 978-953-307-322-4, InTech (2011)