基于 LSTM 的相似度度量与谱聚类在说话人日志中的应用
音频与语音处理
2019-12-02 v1 机器学习
声音
机器学习
摘要
越来越多的神经网络方法在说话人日志系统的子模块上取得了显著改进,包括说话人切换检测和逐段说话人嵌入提取。尽管如此,在聚类阶段,传统算法如概率线性判别分析 (PLDA) 仍被广泛用于对两个语音片段之间的相似度进行评分。在本文中,我们提出了一种有监督方法,利用序列化双向长短期记忆网络 (Bi-LSTM) 度量一段录音所有片段之间的相似度矩阵。在相似度矩阵之上应用谱聚类以进一步提升性能。实验结果表明,我们的系统显著优于 state-of-the-art 方法,并在 NIST SRE 2000 CALLHOME 数据库上实现了 6.63% 的日志错误率。
引用
@article{arxiv.1907.10393,
title = {LSTM based Similarity Measurement with Spectral Clustering for Speaker Diarization},
author = {Qingjian Lin and Ruiqing Yin and Ming Li and Hervé Bredin and Claude Barras},
journal= {arXiv preprint arXiv:1907.10393},
year = {2019}
}
备注
Accepted for INTERSPEECH 2019