说话人日志中 x-vector 序列的贝叶斯 HMM 聚类(VBx):理论、实现与标准任务上的分析
音频与语音处理
2021-01-01 v1 声音
摘要
最近提出的 VBx 日志方法使用贝叶斯隐马尔可夫模型在 x-vector 序列中寻找说话人聚类。在这项工作中,我们对 VBx 日志方法与其他文献中的方法进行了广泛的性能比较,并表明 VBx 在三个最流行的日志评估数据集上取得了优越性能:CALLHOME、AMI 和 DIHARDII 数据集。此外,我们首次给出了 VBx 模型的推导与更新公式,重点关注该模型相较于先前在逐帧标准倒谱特征上工作的更复杂 BHMM 模型的效率与简洁性。随本出版物一同发布,我们给出了在宽带与窄带数据上用于实验的 x-vector 提取器训练方案,以及在全部三个数据集上达到最先进性能的 VBx 方案。此外,我们指出了 AMI 数据集缺乏标准化评估协议的问题,并基于官方 AMI 划分与转写提出了针对 Beamformed 与 Mix-Headset 音频的新协议。
引用
@article{arxiv.2012.14952,
title = {Bayesian HMM clustering of x-vector sequences (VBx) in speaker diarization: theory, implementation and analysis on standard tasks},
author = {Federico Landini and Ján Profant and Mireia Diez and Lukáš Burget},
journal= {arXiv preprint arXiv:2012.14952},
year = {2021}
}
备注
Submitted to Computer Speech and Language, Special Issue on Separation, Recognition, and Diarization of Conversational Speech