中文

通过组适配融合网络改善说话人验证的公平性

音频与语音处理 2024-02-09 v1 声音

摘要

现代说话人验证模型使用深度神经网络将语句音频编码为判别性嵌入向量。在训练过程中,这些网络通常被优化以区分任意说话人。该学习过程使精细语音特征的学习偏向主导人口群体,从而导致不同群体间出现不公平的性能差异。这一点在具有相似语音特征的代表性不足的人口群体中尤为明显。本文中,我们在具有不均衡性别分布的受控数据集上研究说话人验证模型的公平性,直接证明代表性不足群体的模型性能受损。为缓解此差异,我们提出组适配融合网络(GFN)架构,一种基于组嵌入适配与分数融合的模块化架构。我们表明,该方法通过整体及对各单独群体改善说话人验证,减轻了模型不公平性。在训练群体表示不均衡的情况下,相较于基线,我们提出的方法实现了整体相等错误率(EER)相对降低 9.6% 至 29.0%,少数群体 EER 降低 13.7% 至 18.6%,并使 EER 差异减少 20.0% 至 25.4%。该方法可应用于说话人识别系统中其他类型的训练数据偏斜。

关键词

引用

@article{arxiv.2202.11323,
  title  = {Improving fairness in speaker verification via Group-adapted Fusion Network},
  author = {Hua Shen and Yuguang Yang and Guoli Sun and Ryan Langman and Eunjung Han and Jasha Droppo and Andreas Stolcke},
  journal= {arXiv preprint arXiv:2202.11323},
  year   = {2024}
}

备注

To appear in Proc. IEEE ICASSP 2022