中文

基于主动表观模型进行句子唇读的探索

图像与视频处理 2018-05-31 v1 音频与语音处理

摘要

自动唇读对语音识别具有重大潜在影响,可补充和完善声学模态。由于适当音视频数据集的匮乏,大多数唇读尝试都在小词汇量任务上进行。本工作中我们使用公开可用的TCD-TIMIT数据库,该库为大规模词汇连续音视频语音识别设计。我们在传统隐马尔可夫模型(HMM)框架下,比较最广泛使用的唇读特征——离散余弦变换(DCT)与主动表观模型(AAM)的视位识别性能。我们还利用了AAM拟合的最新进展。我们发现对于含56位说话人的视位识别任务,DCT表现优于AAM超过6%。DCT的总体准确率相当低(32-34%)。我们得出结论,该任务可能需要对视觉特征建模进行根本性反思。

关键词

引用

@article{arxiv.1805.11688,
  title  = {Towards Lipreading Sentences with Active Appearance Models},
  author = {George Sterpu and Naomi Harte},
  journal= {arXiv preprint arXiv:1805.11688},
  year   = {2018}
}

备注

Presented at The 14th International Conference on Auditory-Visual Speech Processing (AVSP 2017)