Codecfake 数据集及用于深度伪造音频的通用检测对策
声音
2024-12-30 v3 人工智能
音频与语音处理
摘要
随着基于音频语言模型 (ALM) 的深度伪造音频的普及,亟需 develops 通用检测方法。基于 ALM 的深度伪造音频具有广泛、高欺骗性和多样性,给目前仅针对声道数据训练的音频深度伪造检测 (ADD) 模型构成重大挑战。为了有效检测基于 ALM 的深度伪造音频,我们关注基于 ALM 的音频生成方法的机制,即从神经编解码器到波形的转换。我们最初构建了 Codecfake 数据集,这是一个开源的大规模数据集合,包含超过 100 万中英文音频样本,旨在针对基于 ALM 的音频检测。作为对策,为实现深度伪造音频的通用检测并解决原始锐度感知最小化 (SAM) 方法在域升 bias 方面的问题,我们提出了 CSAM 策略,以学习域平衡和通用的最小值。在我们的实验中,我们首先证明了使用 Codecfake 数据集训练的 ADD 模型能够有效检测基于 ALM 的音频。进一步地,我们提出的泛化对策在所有测试条件下的平均等错误率 (EER) 为 0.616%,低于基线模型。该数据集和相关代码已在线上提供。
引用
@article{arxiv.2405.04880,
title = {The Codecfake Dataset and Countermeasures for the Universally Detection of Deepfake Audio},
author = {Yuankun Xie and Yi Lu and Ruibo Fu and Zhengqi Wen and Zhiyong Wang and Jianhua Tao and Xin Qi and Xiaopeng Wang and Yukun Liu and Haonan Cheng and Long Ye and Yi Sun},
journal= {arXiv preprint arXiv:2405.04880},
year = {2024}
}