一种使用K-NN和SVM分类不流利与流利语音的方法
声音
2013-01-10 v1 人工智能
摘要
本文提出了一种使用梅尔频率倒谱系数(MFCC)分类不流利与流利语音的新方法。当一个人的言语轻松顺畅地流动时,即为流利语音。声音组合成音节,音节混合成词语,词语轻松地连接成句子。当某人的言语不流利时,它是不规则的,不能毫不费力地流动。因此,不流利是流畅、有意义的语流中的中断。口吃就是这样一种障碍,其中流畅的语流被重复、延长、插入等不流利现象所打断。在这项工作中,我们考虑了重复、延长和插入这三种类型的不流利现象来表征不流利语音。在获得不流利和流利语音后,对语音信号进行分析以提取MFCC特征。使用k-最近邻(k-NN)和支持向量机(SVM)分类器将语音分类为不流利和流利语音。80%的数据用于训练,20%用于测试。对于不流利和流利语音,分别获得了86.67%和93.34%的平均准确率。
引用
@article{arxiv.1301.1932,
title = {An Approach for Classification of Dysfluent and Fluent Speech Using K-NN And SVM},
author = {P. Mahesha and D. S. Vinod},
journal= {arXiv preprint arXiv:1301.1932},
year = {2013}
}
备注
10 pages,4 figures; International Journal of Computer Science, Engineering and Applications (IJCSEA) Vol.2, No.6, December 2012