基于因果解�合的多语言说话人嵌入对比学习
声音
2026-02-03 v1 计算与语言
音频与语音处理
摘要
自监督说话人嵌入在说话人验证系统中广泛应用,但 prior work表明它们常常编码敏感人口统计属性,引发公平性和隐私担忧。本文探讨了人口统计信息(具体包括性别、年龄和方言)在SimCLR训练的说话人嵌入中的程度,以及在不严重降低说话人验证性能的前提下,这种信息泄漏是否可被缓解。我们研究了两种去偏策略:通过梯度反转的对抗训练,以及一种显式分离人口统计信息和残差信息的因果瓶颈架构。通过线性和非线性探测分类器量化人口统计信息泄漏情况,而使用ROC-AUC和EER评估说话人验证性能。我们的结果表明,性别信息在基线嵌入中被强烈且线性地编码,而年龄和方言则较弱,主要以非线性方式表征。对抗性去偏减少了性别信息泄漏,但对年龄和方言影响有限,并在验证准确率上引入明显的权衡。因果瓶颈进一步抑制了人口统计信息,尤其在残差表示中,但造成显著的性能下降。这些发现揭示了在自监督说话人嵌入中缓解人口统计信息泄漏的根本性限制,阐明了当前去偏方法所固有的权衡。
引用
@article{arxiv.2602.01363,
title = {Causally Disentangled Contrastive Learning for Multilingual Speaker Embeddings},
author = {Mariëtte Olijslager and Seyed Sahand Mohammadi Ziabari and Ali Mohammed Mansoor Alsahag},
journal= {arXiv preprint arXiv:2602.01363},
year = {2026}
}