使用离散余弦变换的视觉语音识别三维方法
计算机视觉与模式识别
2016-09-08 v1
摘要
视觉语音识别旨在从连续语音中识别音素序列。与使用 2D 图像特征提取方法分别导出每个视频帧特征的传统方法不同,本文提出了一种新方法,使用 3D(时空)离散余弦变换提取输入视频中每个可行子序列的特征,随后使用支持向量机对其进行单独分类,并利用定制的隐马尔可夫模型将其组合以找到最可能的音素序列。该算法在 VidTimit 数据库上进行了训练和测试,以识别音素序列以及视素(视觉语音单元)序列。此外,该系统通过在音素或视素对(双音素)上进行训练进行了扩展,以抵消协同发音带来的人类语音模糊性。音素序列识别的测试集准确率为 20%,视素序列的准确率为 39%。这两个结果均比其他论文中报告的最佳值提高了约 2%。该结果的贡献有三方面:首先,本文首次表明,尽管每个音素的起始位置和持续时间未知,3D 特征提取方法仍可应用于连续序列识别任务。其次,结果证实,与 2D 特征提取方法相比,3D 特征提取方法提高了准确率。第三,本文首次专门比较了使用和不使用双音素的在其他方面完全相同的方法,验证了双音素的使用对结果有积极影响。
引用
@article{arxiv.1609.01932,
title = {A three-dimensional approach to Visual Speech Recognition using Discrete Cosine Transforms},
author = {Toni Heidenreich and Michael W. Spratling},
journal= {arXiv preprint arXiv:1609.01932},
year = {2016}
}
备注
Revised and shortened version of the Master's thesis of the author (King's College London, 2013)