基于直方图变换的说话人识别
声音
2020-02-04 v2 音频与语音处理
机器学习
摘要
提出了一种新颖的文本无关说话人识别(SI)方法。该方法使用梅尔频率倒谱系数(MFCCs)以及相邻帧间的动态信息作为特征集以捕捉说话人特征。为利用动态信息,我们通过将三个相邻 MFCCs 帧级联在一起设计超 MFCCs 特征。这些超 MFCCs 特征的概率密度函数(PDF)由近期提出的直方图变换(HT)方法估计,该方法通过随机变换生成更多训练数据以实现直方图 PDF 估计,并缓解了多元直方图计算中常见的不连续问题。与高斯混合模型等传统 PDF 估计方法相比,HT 模型在 SI 性能上表现出有前景的提升。
引用
@article{arxiv.1808.00959,
title = {Histogram Transform-based Speaker Identification},
author = {Zhanyu Ma and Hong Yu},
journal= {arXiv preprint arXiv:1808.00959},
year = {2020}
}
备注
Technical Report