中文

面向深度说话人确认的多锥特征优化

声音 2021-10-27 v1 人工智能 音频与语音处理

摘要

多锥估计器提供低方差的功率谱估计,可替代加窗离散傅里叶变换(DFT)来提取诸如梅尔频率倒谱系数(MFCCs)等语音特征。尽管以往工作在使用基于高斯混合模型分类器时报告了有前景的自动说话人确认(ASV)结果,多锥MFCCs在深度ASV系统中的性能仍是一个开放问题。我们提出不采用静态锥设计,而是将多锥估计器与为ASV任务训练的深度神经网络联合优化。相较于静态锥,我们的方法在SITW语料库上以等错误率计最高提升25.8%,有助于保持泄漏与方差的平衡水平,提供更强的鲁棒性。

关键词

引用

@article{arxiv.2110.10983,
  title  = {Optimizing Multi-Taper Features for Deep Speaker Verification},
  author = {Xuechen Liu and Md Sahidullah and Tomi Kinnunen},
  journal= {arXiv preprint arXiv:2110.10983},
  year   = {2021}
}

备注

To appear in IEEE Signal Processing Letters