基于多层自助网络学习深度表示用于说话人日志
音频与语音处理
2019-10-25 v1
摘要
说话人日志的性能在测试阶段强烈受其聚类算法的影响。然而,众所周知,聚类算法对随机噪声和微小变化敏感,尤其是当聚类算法本身存在一些缺陷时,例如糟糕的局部极小值和先验假设。为处理该问题,通常需要语音片段具有类内方差小、类间距离大的紧凑表示。本文中,我们应用一种名为多层自助网络(multilayer bootstrap network, MBN)的无监督深度模型,针对上述问题描述语音片段的嵌入向量。MBN是一种用于非线性降维的无监督深度模型。与传统基于神经网络的深度模型不同,它由-质心聚类集成堆叠而成,其中每一个仅需通过对数据进行随机重采样和最近邻优化即可简单训练。我们通过将MBN与i-vector前端或x-vector前端相结合来构建说话人日志系统,并在模拟的NIST日志数据集、AMI会议语料库以及NIST SRE 2000 CALLHOME数据库上评估其有效性。实验结果表明,所提系统优于或至少可与不使用MBN的系统相媲美。
引用
@article{arxiv.1910.10969,
title = {Learning deep representations by multilayer bootstrap networks for speaker diarization},
author = {Meng-Zhen Li and Xiao-Lei Zhang},
journal= {arXiv preprint arXiv:1910.10969},
year = {2019}
}
备注
5 pages, 4figures,coference