中文

基于相互信息最小化方法的跨年龄说话人验证中的身份与年龄 disentanglement

声音 2024-09-25 v1 人工智能 音频与语音处理

摘要

跨年龄说话人验证(CASV)研究兴趣日益增长。然而,现有说话人验证系统因个体语音因 aging 产生的巨大差异,在 CASV 场景中表现不佳。本文提出一种基于相互信息(MI)最小化的CASV无监督表征学习框架。该方法中, backbone 模型被训练用于从说话人信息中 disentangle 出身份相关和年龄相关的表征;而 MI 估计器则通过 MI 最小化来最小化年龄相关与身份相关表征之间的相关性,从而实现年龄不变的说话人表征。此外,利用正负样本之间的年龄差,本文提出一种 aging-aware MI 最小化损失函数,使 backbone 模型更关注大年龄差的语音变化。实验结果表明,所提方法在 Vox-CA 多个跨年龄测试集上优于其他方法。

关键词

引用

@article{arxiv.2409.15974,
  title  = {Disentangling Age and Identity with a Mutual Information Minimization Approach for Cross-Age Speaker Verification},
  author = {Fengrun Zhang and Wangjin Zhou and Yiming Liu and Wang Geng and Yahui Shan and Chen Zhang},
  journal= {arXiv preprint arXiv:2409.15974},
  year   = {2024}
}

备注

Interspeech 2024