面向说话人日志的概率化嵌入
音频与语音处理
2020-11-09 v3 机器学习
声音
机器学习
摘要
从极短语音段中提取的说话人嵌入(x-vectors)近来已被证明在说话人日志中给出具有竞争力的性能。我们推广该方案:从每个语音段中并行提取 x-vector 与一个对角精度矩阵,从而为将语音段质量信息传入 PLDA 打分后端提供路径。这些精度量化了:若从高质量语音段提取,嵌入值可能为何种取值的不确定性。所提出的概率化嵌入(带精度的 x-vectors)通过将 x-vectors 视为隐变量并对其进行边缘化,与 PLDA 模型相接。我们将所提概率化嵌入作为凝聚式层次聚类(AHC)算法的输入,在 DIHARD'19 评测集上完成日志任务。我们对 AHC 所考虑的每一个聚类假设均“按部就班”地计算完整 PLDA 似然。我们对 PLDA 参数与概率化 x-vector 提取器进行联合判别训练。相对于应用于传统 x-vectors(不含不确定性)并使用二元对数似然比平均而非按部就班打分的基线 AHC 算法,我们展示了准确率的提升。
引用
@article{arxiv.2004.04096,
title = {Probabilistic embeddings for speaker diarization},
author = {Anna Silnova and Niko Brümmer and Johan Rohdin and Themos Stafylakis and Lukáš Burget},
journal= {arXiv preprint arXiv:2004.04096},
year = {2020}
}
备注
Awarded: Jack Godfrey Best Student Paper Award, at Odyssey 2020: The Speaker and Language Recognition Workshop, Tokio