中文

用于加速 i-Vector 系统开发的超向量压缩策略

音频与语音处理 2018-05-04 v1 计算与语言 机器学习 声音 机器学习

摘要

前端因子分析(FEFA)是主成分分析(PPCA)针对高斯混合模型(GMMs)的扩展,目前是提取紧凑的语句级特征(i-vectors)用于自动说话人验证(ASV)系统的主流方法。将 FEFA 与应用于最大后验(MAP)自适应 GMM 超向量的常规 PPCA 进行比较的研究很少。我们研究了若干替代方法,包括 PPCA、因子分析(FA)以及两种有监督方法——有监督 PPCA(SPPCA)和近期提出的概率偏最小二乘(PPLS),以压缩 MAP 自适应的 GMM 超向量。所得 i-vectors 用于带有概率线性判别分析(PLDA)后端的 ASV 任务。我们在两个不同数据集上实验:NIST SRE 2010 的电话条件,以及近期从包含名流访谈的 YouTube 视频中收集的、录制于多种声学与技术条件的 VoxCeleb 语料库。结果表明,就 ASV 准确率而言,超向量压缩方法与 FEFA 相当。有监督方法未带来性能提升。与 FEFA 相比,使用 PPCA 和 FA 超向量压缩方法我们在总变异性模型(TVM)训练中获得了超过百倍(100x)的加速。

关键词

引用

@article{arxiv.1805.01156,
  title  = {Supervector Compression Strategies to Speed up I-Vector System Development},
  author = {Ville Vestman and Tomi Kinnunen},
  journal= {arXiv preprint arXiv:1805.01156},
  year   = {2018}
}

备注

To appear in Speaker Odyssey 2018: The Speaker and Language Recognition Workshop