利用 Zernike 矩和 MFCC 特征进行视听语音识别中的孤立词识别
计算机视觉与模式识别
2014-07-07 v1 计算与语言
摘要
机器自动语音识别(ASR)是信号处理领域一个极具吸引力的研究课题,吸引了许多研究人员投身于此。近年来,随着音频和视觉语音特征的引入以在噪声条件下识别单词,自动唇读系统取得了许多进展。视听语音识别系统的目标是提高识别准确率。在本文中,我们在 vVISWa(独立标准词视觉词汇)数据集上计算了使用 Zernike 矩的视觉特征和使用梅尔频率倒谱系数(MFCC)的音频特征,该数据集包含 10 位说话人的城市名称孤立词集合。视觉特征经过归一化处理,并通过主成分分析(PCA)降低了特征集的维度,以便在 PCA 空间上识别孤立词发音。基于仅视觉特征和仅音频特征的孤立词识别性能结果分别为 63.88 和 100。
引用
@article{arxiv.1407.1165,
title = {Recognition of Isolated Words using Zernike and MFCC features for Audio Visual Speech Recognition},
author = {Prashant Bordea and Amarsinh Varpeb and Ramesh Manzac and Pravin Yannawara},
journal= {arXiv preprint arXiv:1407.1165},
year = {2014}
}