解耦概率线性判别分析研究
声音
2021-11-25 v1 音频与语音处理
摘要
概率线性判别分析(PLDA)在诸如说话人验证等开放集验证任务中有着广泛应用。PLDA 的一个关键问题是模型过于简单(线性高斯),难以处理复杂数据;然而,这种简单性本身是 PLDA 的一个主要优势,因为它能带来理想的泛化能力。因此,一个有趣的研究方向是如何在保持简单性的同时提高 PLDA 的建模能力。本文提出了一种解耦方法,该方法包含一个简单且可泛化的全局模型,以及一个复杂且富有表达力的局部模型。全局模型对整个数据持有全局视角,而局部模型则代表各个类别的细节。我们朝着这个方向进行了初步研究,并探讨了一个包含全局和局部模型的简单解耦模型。这个我们称之为解耦 PLDA 的新模型在说话人验证任务上进行了测试。实验结果表明,当模型基于原始说话人向量时,它始终优于普通 PLDA。然而,当说话人向量经过长度归一化处理后,解耦 PLDA 的优势将大部分丧失,这提示了未来在非线性局部模型上的研究方向。
引用
@article{arxiv.2111.12326,
title = {A Study on Decoupled Probabilistic Linear Discriminant Analysis},
author = {Di Wang and Lantian Li and Hongzhi Yu and Dong Wang},
journal= {arXiv preprint arXiv:2111.12326},
year = {2021}
}