中文

VBx说话人日志的判别式训练

音频与语音处理 2023-10-05 v1 声音

摘要

x向量序列的贝叶斯HMM聚类(VBx)已成为论文和评测中广泛采用的说话人日志基线模型。它使用HMM对说话人切换建模,使用生成式训练的概率线性判别分析(PLDA)进行说话人分布建模,并使用贝叶斯推断来估计x向量到说话人的分配。本文提出了一种利用判别式训练更新VBx参数的新框架,该框架直接优化预定义的损失。我们还提出了一种与说话人日志错误率相关性优于二元交叉熵\unicodex2013\unicode{x2013}(端到端说话人日志系统的默认选择)的新损失。在三个数据集(AMI、CALLHOME和DIHARD II)上的概念验证结果表明,该方法能够自动寻找超参数,取得与通过大量网格搜索找到的超参数相当的性能,而网格搜索通常需要额外的超参数行为知识。此外,我们表明PLDA的判别式微调可进一步提升模型性能。我们随本文发布了源代码。

关键词

引用

@article{arxiv.2310.02732,
  title  = {Discriminative Training of VBx Diarization},
  author = {Dominik Klement and Mireia Diez and Federico Landini and Lukáš Burget and Anna Silnova and Marc Delcroix and Naohiro Tawara},
  journal= {arXiv preprint arXiv:2310.02732},
  year   = {2023}
}

备注

Submitted to ICASSP 2024