统一说话人验证中的余弦与 PLDA 后端
声音
2022-04-25 v1 音频与语音处理
摘要
最先进的说话人验证(SV)系统使用后端模型对从神经网络模型提取的说话人嵌入的相似性进行打分。常用的后端模型有余弦打分与概率线性判别分析(PLDA)打分。随着近期开发的神经嵌入,理论上更具吸引力的 PLDA 方法在 SV 系统性能上被发现相较于简单余弦打分并无优势甚至更差。本文对两种打分方法之间的关系进行了探究,旨在解释上述反直觉现象。结果表明余弦打分本质上是 PLDA 打分的一种特例。换言之,通过恰当设置 PLDA 的参数,两个后端变得等价。因此,余弦打分不仅继承了 PLDA 的基本假设,还对输入嵌入的性质引入了额外假设。实验表明,在域匹配条件下,余弦打分所需的维度独立性假设是两种方法性能差距的主要贡献因素。当存在严重域失配且维度独立性假设不成立时,PLDA 相较于余弦在域适应上表现更好。
引用
@article{arxiv.2204.10523,
title = {Unifying Cosine and PLDA Back-ends for Speaker Verification},
author = {Zhiyuan Peng and Xuanji He and Ke Ding and Tan Lee and Guanglu Wan},
journal= {arXiv preprint arXiv:2204.10523},
year = {2022}
}
备注
submitted to interspeech2022