全监督说话人日志方法
音频与语音处理
2019-02-20 v7 机器学习
机器学习
摘要
本文中,我们提出一种全监督说话人日志方法,称为无界交错状态循环神经网络(UIS-RNN)。给定从输入语句中提取的说话人可分辨嵌入(又称 d-vector),每个个体说话人由一个参数共享的 RNN 建模,而不同说话人的 RNN 状态在时间域中交错。该 RNN 自然地与距离依赖的中国餐馆过程(ddCRP)相集成,以适应未知数量的说话人。我们的系统是全监督的,并能够从带有时间戳说话人标签标注的示例中学习。我们在 NIST SRE 2000 CALLHOME 上取得了 7.6% 的日志错误率,优于使用谱聚类的现有最优方法。此外,我们的方法以在线方式解码,而大多数最优系统依赖于离线聚类。
引用
@article{arxiv.1810.04719,
title = {Fully Supervised Speaker Diarization},
author = {Aonan Zhang and Quan Wang and Zhenyao Zhu and John Paisley and Chong Wang},
journal= {arXiv preprint arXiv:1810.04719},
year = {2019}
}
备注
Accepted by ICASSP 2019