中文

基于频率-时间强化学习的全类型音频深度伪造检测

声音 2026-01-07 v1 人工智能

摘要

近期音频大语言模型(ALLMs)的进展使得高质量的人造音频广为可得,增加了跨语种、环境声、歌声和音乐的恶意音频深度伪造的风险。实际中的音频深度伪造检测(ADD)需要具备能够泛化到异构音频并提供可解释决策的全类型检测器。鉴于ALLMs在多任务泛化方面的强大能力,我们首先探讨了其在监督微调(SFT)和强化微调(RFT)下的全类型ADD性能。然而,仅使用二元真假标签的SFT倾向于将模型简化为黑箱分类器,牺牲了可解释性。而零样本RFT在稀疏监督下容易出现奖励攻击,可能产生无根据且幻觉的理由。为此,我们提出了一种自动标注和润色管道,用于构建频率-时间结构化链式思维(CoT)理由,产生约34万条冷启动演示。基于CoT数据,我们提出了频率-时间组相对策略优化(FT-GRPO)方法,该方法采用两阶段训练范式:先用SFT cold-start ALLMs,然后在基于频率-时间约束的规则下应用GRPO。实验表明,FT-GRPO在全类型ADD上实现了最佳性能,同时生成可解释且基于频率-时间的理由。该数据和代码已公开于线上。

关键词

引用

@article{arxiv.2601.02983,
  title  = {Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning},
  author = {Yuankun Xie and Xiaoxuan Guo and Jiayi Zhou and Tao Wang and Jian Liu and Ruibo Fu and Xiaopeng Wang and Haonan Cheng and Long Ye},
  journal= {arXiv preprint arXiv:2601.02983},
  year   = {2026}
}