使用深度信念网络的说话人识别
音频与语音处理
2018-05-24 v1 声音
摘要
诸如梅尔频率倒谱系数(MFCCs)的短时谱特征先前已部署于最先进的说话人识别系统中,然而人们较少关注可由生成学习模型从语音信号中学得的短期谱特征。诸如深度信念网络(DBNs)的更高维编码器可通过更好地建模声波的统计结构来提升说话人识别任务的性能。在本文中,我们使用从DBN学到的短时谱特征并辅以MFCC特征来执行说话人识别任务。使用我们的特征,我们在ELSDSR数据集上取得了0.95的识别准确率,而使用独立MFCC特征时为0.90。
引用
@article{arxiv.1805.08865,
title = {Speaker Recognition using Deep Belief Networks},
author = {Adrish Banerjee and Akash Dubey and Abhishek Menon and Shubham Nanda and Gora Chand Nandi},
journal= {arXiv preprint arXiv:1805.08865},
year = {2018}
}