基音同步DCT特征:说话人识别的一项初步研究
音频与语音处理
2018-12-07 v1 声音
摘要
我们提出一种新特征,即基音同步离散余弦变换(PS-DCT),用于说话人识别任务。这些特征直接取自语音信号的浊音段,无需任何预加重或加窗。特征向量被矢量量化,在训练期间为每个说话人创建一个单独的码本。PS-DCT特征被证明性能良好,因此可用于补充说话人识别任务中的其他特征。还使用梅尔频率倒谱系数(MFCC)特征进行说话人识别,并与所提特征结合以提高其性能。在本初步研究中,从TIMIT数据库中随机选取30名说话人(14名女性、16名男性)用于说话人识别任务。在该数据上,所提特征和MFCC在码本大小为16和32时分别给出90%和96.7%的识别准确率,而组合特征达到100%的性能。除说话人识别任务外,本工作还展示了DCT以最小预处理从语音信号中捕获判别信息的能力。
引用
@article{arxiv.1812.02447,
title = {Pitch-synchronous DCT features: A pilot study on speaker identification},
author = {Amit Meghanani and A G Ramakrishnan},
journal= {arXiv preprint arXiv:1812.02447},
year = {2018}
}