中文

用于说话人日志化的判别神经聚类

音频与语音处理 2020-11-24 v2 计算与语言 计算机视觉与模式识别 机器学习 声音

摘要

在本文中,我们提出判别神经聚类(Discriminative Neural Clustering, DNC),其将具有最大簇数的数据聚类表述为一个有监督的序列到序列学习问题。与传统的无监督聚类算法相比,DNC 从训练数据中学习聚类模式,而无需显式定义相似度度量。基于 Transformer 架构的 DNC 实现在使用具有挑战性的 AMI 数据集的说话人日志化任务上被证明是有效的。由于 AMI 仅包含 147 场完整会议作为独立输入序列,数据稀缺是训练用于 DNC 的 Transformer 模型的显著问题。据此,本文提出三种数据增强方案:子序列随机化、输入向量随机化以及 Diaconis 增强,后者通过对 L2 归一化的说话人嵌入的整个输入序列进行旋转来生成新数据样本。在 AMI 上的实验结果表明,相对于谱聚类,DNC 在说话人错误率(SER)上实现了 29.4% 的相对降低。

关键词

引用

@article{arxiv.1910.09703,
  title  = {Discriminative Neural Clustering for Speaker Diarisation},
  author = {Qiujia Li and Florian L. Kreyssig and Chao Zhang and Philip C. Woodland},
  journal= {arXiv preprint arXiv:1910.09703},
  year   = {2020}
}

备注

Accepted as a conference paper at the 8th IEEE Spoken Language Technology Workshop (SLT 2021)