中文

音频深度伪造检测中的性别公平性:性能与差异分析

声音 2026-05-12 v2 人工智能

摘要

音频深度伪造检测旨在检测来自人类真实语音与人工智能生成语音的区别,已成为声纹生物识别领域的重要问题。随着合成语音质量的不断提升,这类语音被用于非法活动(如身份冒充与伪装)的可能性日益增加。尽管近年来在音频深度伪造检测方面取得了显著进展,但性别偏差问题仍鲜有探讨且处于萌芽阶段。本文尝试对音频深度伪造检测模型的性别相关性能与公平性进行彻底分析。我们采用ASVspoof 5数据集,训练ResNet-18分类器,并评估四种不同音频特征的检测性能,同时与基线AASIST模型进行比较。除常用Equal Error Rate(EER%)等指标外,我们还纳入五个既定公平性指标,以量化模型在性别差异方面的不公平程度。我们的结果表明,尽管性别间整体EER差异看似较小,但基于公平性的评估揭示了被聚合绩效掩盖的错误分布差异。这些发现表明,仅依赖标准指标是不可靠的,而公平性指标为揭示特定人口统计组的失效模式提供了关键见解。本工作凸显了在开发更公平、稳健且可信赖的音频深度伪造检测系统方面,公平性感知评估的重要性。

关键词

引用

@article{arxiv.2603.09007,
  title  = {Gender Fairness in Audio Deepfake Detection: Performance and Disparity Analysis},
  author = {Aishwarya Fursule and Shruti Kshirsagar and Anderson R. Avila},
  journal= {arXiv preprint arXiv:2603.09007},
  year   = {2026}
}

备注

Paper Accepted to IEEE CAI Conference 2026