面向自动说话人验证的可训练自适应得分归一化
音频与语音处理
2025-04-08 v1
摘要
自适应 S-norm (AS-norm) 通过归一化自动说话人验证 (ASV) 的得分,利用与输入说话人相似的冗余说话人的得分来实现校准。然而,AS-norm 不涉及任何学习过程,限制了其为各种评估语料提供合适正则化强度的能力。为此,我们提出一种可训练的 AS-norm (TAS-norm),该方法利用可学习的冗余说话人嵌入向量 (LIEs),用于构成评估队列。这些 LIEs 被初始化以表示由冗余说话人组成的训练数据集中的每个说话人。随后,通过模拟 ASV 评估来微调 LIEs。在挑选得分最高的嵌入向量时,我们利用边际惩罚以防止非冗余说话人被选中。在使用 ECAPA-TDNN 的实验中,提出的 TAS-norm 在 VoxCeleb1-O 试验中相对于标准 AS-norm(不使用提出的 LIEs)在等错误率和最小检测费用函数上分别观察到 4.11% 和 10.62% 的相对改进。我们进一步在包含波斯语和中文数据集的实验中验证了 TAS-norm 的有效性,展示了其在不同语言之间的鲁棒性。
引用
@article{arxiv.2504.04512,
title = {Trainable Adaptive Score Normalization for Automatic Speaker Verification},
author = {Jeong-Hwan Choi and Ju-Seok Seong and Ye-Rin Jeoung and Joon-Hyuk Chang},
journal= {arXiv preprint arXiv:2504.04512},
year = {2025}
}
备注
Accepted at ICASSP'25