中文

用于在线说话人识别与聚类的概率后端

音频与语音处理 2023-02-21 v1 机器学习 声音 信号处理

摘要

本文聚焦于在线说话人聚类任务中自然出现的多注册说话人识别,并研究了此场景下不同评分后端的特性。首先,我们展示了流行的余弦评分在注册话语数量变化时存在评分校准不佳的问题。其次,我们提出了一种基于极简约束版概率线性判别分析的余弦评分的简单替代方案。所提出的模型在多注册识别方面优于余弦评分,同时在一对一比较的情况下保持了相同的性能。最后,我们考虑了一个在线说话人聚类任务,其中每一步都自然涉及多注册识别。我们提出了一种在线聚类算法,使我们能够从PLDA模型中获益,例如处理不确定性和更好的评分校准能力。我们的实验证明了所提出算法的有效性。

关键词

引用

@article{arxiv.2302.09523,
  title  = {Probabilistic Back-ends for Online Speaker Recognition and Clustering},
  author = {Alexey Sholokhov and Nikita Kuzmin and Kong Aik Lee and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2302.09523},
  year   = {2023}
}

备注

Accepted to ICASSP 2023