中文

基于切比雀夫多项式和黎曼度量学习解构说话特征用于深度伪造源验证

音频与语音处理 2026-03-24 v1 计算与语言 声音

摘要

语音深度伪造源验证系统旨在确定两个合成语音 utterance 是否来自同一 source generator,常假设 resulting source embeddings 与说话人特征独立。然而,这一假设尚未得到验证。本文首先检验说话人因素对源验证的影响。我们提出了一种说话人解构度量学习(SDML)框架,包含两个新损失函数。第一个利用切比雀夫多项式缓解解构优化中的梯度不稳定性。第二个将 source 和 speaker embeddings 投影到双曲空间,利用黎曼度量距离减少说话人信息并学习更具辨识力的 source 特征。在 MLAAD 数据集上进行的实验结果显示,SDML 框架在四个旨为 source-speaker 解构场景设计的新方法评估协议下表现出色。代码、评估协议和演示网站均可在 https://github.com/xxuan-acoustics/RiemannSD-Net 查看。

关键词

引用

@article{arxiv.2603.21875,
  title  = {Disentangling Speaker Traits for Deepfake Source Verification via Chebyshev Polynomial and Riemannian Metric Learning},
  author = {Xi Xuan and Wenxin Zhang and Zhiyu Li and Jennifer Williams and Ville Hautamäki and Tomi H. Kinnunen},
  journal= {arXiv preprint arXiv:2603.21875},
  year   = {2026}
}

备注

Submitted to Interspeech 2026; The code, evaluation protocols and demo website are available at https://github.com/xxuan-acoustics/RiemannSD-Net