Codecfake:检测基于大语言模型深度伪造音频的初始数据集
声音
2024-06-13 v1 人工智能
音频与语音处理
摘要
随着基于大语言模型 (LLM) 的深度伪造音频的普及,亟需有效的检测方法。以往的深度伪造音频生成方法通常涉及多步骤生成过程,最终步骤使用声码器从手工特征预测波形。然而,LLM-based audio 是直接从离散神经音码中进行端到端生成,跳过了声码器处理步骤。这对基于声码器残留物的当前音频深度伪造检测 (ADD) 模型构成重大挑战。为了有效检测 LLM-based 淈造音频,我们聚焦于生成过程的核心,即从神经音码到波形的转换。我们提出 Codecfake 数据集,该数据集由七种代表性神经音码方法生成。实验结果表明,在 Codecfake 测试集上,基于音码训练的 ADD 模型相对于基于声码器训练的 ADD 模型平均等错误率降低 41.406%。
引用
@article{arxiv.2406.08112,
title = {Codecfake: An Initial Dataset for Detecting LLM-based Deepfake Audio},
author = {Yi Lu and Yuankun Xie and Ruibo Fu and Zhengqi Wen and Jianhua Tao and Zhiyong Wang and Xin Qi and Xuefei Liu and Yongwei Li and Yukun Liu and Xiaopeng Wang and Shuchen Shi},
journal= {arXiv preprint arXiv:2406.08112},
year = {2024}
}
备注
Accepted by INTERSPEECH 2024. arXiv admin note: substantial text overlap with arXiv:2405.04880