中文

用于说话人日志化的带重叠的多类谱聚类

音频与语音处理 2020-11-06 v1 声音

摘要

本文描述了一种重叠感知的说话人日志化方法。给定重叠检测器和说话人嵌入提取器,我们的方法在重叠检测器输出的指导下对片段进行谱聚类。这是通过将离散聚类问题转化为一个由特征分解求解的凸优化问题来实现的。此后,我们通过交替使用奇异值分解和受重叠检测器输出约束的非极大抑制修改版来对解进行离散化。此外,我们详述了一种基于 HMM-DNN 的重叠检测器,其执行帧级分类并通过 HMM 状态转移强制持续时间约束。我们的方法在 AMI 会议语料的混合头戴设置上取得了 24.0% 的测试日志化错误率(DER),相对于一个强凝聚层次聚类基线相对提升了 15.2%,并且优于其他重叠感知的日志化方法。在 LibriCSS 数据上的进一步分析证明了所提方法在高重叠条件下的有效性。

关键词

引用

@article{arxiv.2011.02900,
  title  = {Multi-class Spectral Clustering with Overlaps for Speaker Diarization},
  author = {Desh Raj and Zili Huang and Sanjeev Khudanpur},
  journal= {arXiv preprint arXiv:2011.02900},
  year   = {2020}
}

备注

Accepted at IEEE SLT 2021