中文

用于说话人验证的可学习MFCC

声音 2021-02-23 v1 机器学习 音频与语音处理

摘要

我们提出了一种用于基于深度神经网络(DNN)的自动说话人验证的可学习梅尔频率倒谱系数(MFCC)前端架构。我们的架构保留了基于 MFCC 特征的简洁性与可解释性,同时允许模型灵活地适应数据。实践中,我们将标准 MFCC 提取器的四个线性变换——加窗、离散傅里叶变换(DFT)、梅尔滤波器组和离散余弦变换(DCT)——表述为数据驱动版本。所报告的结果在等错误率(EER)上相对静态 MFCC 取得了高达 6.7%(VoxCeleb1)和 9.7%(SITW)的相对提升,且无需额外的调参工作。

关键词

引用

@article{arxiv.2102.10322,
  title  = {Learnable MFCCs for Speaker Verification},
  author = {Xuechen Liu and Md Sahidullah and Tomi Kinnunen},
  journal= {arXiv preprint arXiv:2102.10322},
  year   = {2021}
}

备注

Accepted to ISCAS 2021