中文

FairSSD:理解合成语音检测器中的偏差

计算机视觉与模式识别 2024-04-18 v1 机器学习 多媒体 声音 音频与语音处理

摘要

能够生成与人类说话者录制的语音在感知上无法区分的合成语音的方法很容易获得。有几起事件报告了滥用这些方法生成的合成语音进行欺诈。为了应对这种滥用,已经提出了许多检测合成语音的方法。其中一些检测器更具可解释性,能够泛化到野外检测合成语音,并且对噪声具有鲁棒性。然而,关于理解这些检测器中的偏差的工作有限。在这项工作中,我们检查了现有合成语音检测器中的偏差,以确定它们是否会不公平地针对特定性别、年龄和口音群体。我们还检查了这些检测器对于语音障碍说话者的真实语音相对于流利说话者是否会有更高的错误分类率。在超过90万个语音信号上对6个现有合成语音检测器进行的广泛实验表明,大多数检测器存在性别、年龄和口音偏差,未来需要确保公平性。为了支持未来的研究,我们在https://gitlab.com/viper-purdue/fairssd发布了我们的评估数据集、研究中使用的模型和源代码。

关键词

引用

@article{arxiv.2404.10989,
  title  = {FairSSD: Understanding Bias in Synthetic Speech Detectors},
  author = {Amit Kumar Singh Yadav and Kratika Bhagtani and Davide Salvi and Paolo Bestagini and Edward J. Delp},
  journal= {arXiv preprint arXiv:2404.10989},
  year   = {2024}
}

备注

Accepted at CVPR 2024 (WMF)