中文

用于增强连续唇读的自动视素词汇构建

计算机视觉与模式识别 2017-04-27 v1

摘要

语音是人类间最常见的交流方式,涉及听觉与视觉通道的感知。自动语音识别聚焦于解释音频信号,但已证明视频可提供与音频互补的信息。因此,自动唇读的研究十分重要且仍是一个开放问题。关键挑战之一是视觉基本单元(视素)及其词汇的定义。许多研究者分析了音素到视素映射的重要性,并提出了长度在11至15个视素之间的视素词汇。这些视素词汇通常依据其语言学特性手动定义,某些情况下使用决策树或聚类技术。本工作中,我们专注于基于相似外观音素关联自动构建最优视素词汇。为此,我们构建了一个自动系统,利用局部外观描述子提取嘴部区域主要特征,并使用隐马尔可夫模型(HMMs)建模视素与音素序列的统计关系。为比较系统性能,分析了不同描述子(PCA、DCT 和 SIFT)。我们在西班牙连续语音语料上测试系统。结果表明,在连续语音场景下我们能够识别约58%的视素、47%的音素和23%的单词,且西班牙语的最优视素词汇由20个视素组成。

关键词

引用

@article{arxiv.1704.08035,
  title  = {Automatic Viseme Vocabulary Construction to Enhance Continuous Lip-reading},
  author = {Adriana Fernandez-Lopez and Federico M. Sukno},
  journal= {arXiv preprint arXiv:1704.08035},
  year   = {2017}
}

备注

International Conference on Computer Vision Theory and Applications (VISAPP 2017)