用于说话人验证的可学习MFCC
声音
2021-02-23 v1 机器学习
音频与语音处理
摘要
我们提出了一种用于基于深度神经网络(DNN)的自动说话人验证的可学习梅尔频率倒谱系数(MFCC)前端架构。我们的架构保留了基于 MFCC 特征的简洁性与可解释性,同时允许模型灵活地适应数据。实践中,我们将标准 MFCC 提取器的四个线性变换——加窗、离散傅里叶变换(DFT)、梅尔滤波器组和离散余弦变换(DCT)——表述为数据驱动版本。所报告的结果在等错误率(EER)上相对静态 MFCC 取得了高达 6.7%(VoxCeleb1)和 9.7%(SITW)的相对提升,且无需额外的调参工作。
引用
@article{arxiv.2102.10322,
title = {Learnable MFCCs for Speaker Verification},
author = {Xuechen Liu and Md Sahidullah and Tomi Kinnunen},
journal= {arXiv preprint arXiv:2102.10322},
year = {2021}
}
备注
Accepted to ISCAS 2021