中文

基于路径积分聚类的自监督表示学习用于说话人日记化

音频与语音处理 2021-06-15 v1 声音

摘要

自动说话人日记化技术通常采用两阶段处理:第一阶段将固定时长的音频段转换为向量表示,随后第二阶段对这些表示进行无监督聚类。在多数已有方法中,这两个阶段以孤立方式执行,具有各自独立的优化步骤。本文提出一种可迭代执行的表示学习与聚类算法,以改进说话人日记化。表示学习基于自监督学习原理,而聚类算法是一种基于路径积分聚类(PIC)的图结构方法。表示学习步骤使用来自 PIC 的聚类目标,聚类步骤则在自监督深度模型学到的嵌入上执行。该迭代方法称为自监督聚类(SSC)。日记化实验在 CALLHOME 和 AMI 会议数据集上进行。实验表明,SSC 算法较基线系统显著提升(在 CALLHOME 和 AMI 数据集上说话人日记化错误率(DER)分别相对改善 13% 和 59%)。此外,本文报告的 DER 结果优于其他若干近期说话人日记化方法。

关键词

引用

@article{arxiv.2104.09456,
  title  = {Self-supervised Representation Learning With Path Integral Clustering For Speaker Diarization},
  author = {Prachi Singh and Sriram Ganapathy},
  journal= {arXiv preprint arXiv:2104.09456},
  year   = {2021}
}

备注

11 pages, Accepted in IEEE Transactions on Audio, Speech and Language Processing