音频深度伪造溯源:一个初步数据集与调查研究
声音
2024-11-19 v4 人工智能
音频与语音处理
摘要
深度语音合成模型的快速进展已对社会构成重大威胁,例如对内容进行恶意操纵。这导致旨在检测所谓深度伪造音频的研究增多。然而,现有工作聚焦于真实音频与伪造音频的二分类检测。在模型版权保护与数字证据取证等现实场景中,仅二分类是不够的。识别深度伪造音频的来源至关重要。因此,音频深度伪造溯源已成为一项新挑战。为此,我们设计了首个用于音频生成工具溯源的深度伪造音频数据集,称为 Audio Deepfake Attribution (ADA),并对系统指纹进行了全面调研。为应对现实世界中持续涌现的未知音频生成工具所带来的溯源挑战,我们提出用于开集音频深度伪造溯源 (OSADA) 的类别表征多中心学习 (CRML) 方法。CRML 增强了表征的全局方向变化,确保学习到具有强类内相似性与类间差异的判别性表征。最终,从已知类别学到的强类别判别能力被扩展到已知与未知类别。实验结果表明,CRML 方法有效应对了现实场景中的开集风险。数据集公开于:https://zenodo.org/records/13318702 与 https://zenodo.org/records/13340666。
引用
@article{arxiv.2208.10489,
title = {Audio Deepfake Attribution: An Initial Dataset and Investigation},
author = {Xinrui Yan and Jiangyan Yi and Jianhua Tao and Jie Chen},
journal= {arXiv preprint arXiv:2208.10489},
year = {2024}
}
备注
13 pages, 5 figures. arXiv admin note: text overlap with arXiv:2208.10489v3