中文

潜类模型及其在说话人日志中的应用

音频与语音处理 2019-04-26 v1

摘要

本文将潜类模型(LCM)应用于说话人日志任务。LCM 与 Patrick Kenny 的变分贝叶斯(VB)方法相似,在其迭代中使用软信息并避免过早的硬决策。与基于生成模型的 VB 方法不同,LCM 提供了一个允许生成式与判别式模型的框架。本文中,判别式性质通过 i-vector (Ivec)、概率线性判别分析(PLDA) 与支持向量机(SVM) 的使用得以实现。我们引入了记为 LCM-Ivec-PLDA、LCM-Ivec-SVM 与 LCM-Ivec-Hybrid 的系统。此外,应用了三项进一步改进以提升性能:1) 添加邻域窗口以提取每个短片段的更多说话人信息;2) 使用隐马尔可夫模型避免频繁的说话人变化点;3) 使用凝聚层次聚类进行初始化并给出硬先验与软先验,以克服初始敏感性问题。在国家标准与技术研究院 Rich Transcription 2009 说话人日志数据库上、单远场麦克风条件下的实验表明,所提方法的日志错误率(DER)相较主流系统有显著的相对提升。与 VB 方法相比,LCM-Ivec-PLDA、LCM-Ivec-SVM 与 LCM-Ivec-Hybrid 系统的相对提升分别为 23.5%、27.1% 与 43.0%。在我们收集的数据库 CALLHOME97、CALLHOME00 以及 SRE08 short2-summed 试验条件下的实验同样表明,所提出的 LCM-Ivec-Hybrid 系统具有最佳整体性能。

关键词

引用

@article{arxiv.1904.11130,
  title  = {Latent Class Model with Application to Speaker Diarization},
  author = {Liang He and Xianhong Chen and Can Xu and Yi Liu and Jia Liu and Michael T Johnson},
  journal= {arXiv preprint arXiv:1904.11130},
  year   = {2019}
}