面向对抗攻击的音频深度伪造检测中的推理转移分析: 推理税与护盾分离
计算与语言
2026-01-08 v1 声音
音频与语音处理
摘要
音频语言模型 (Audio Language Models, ALMs) 提供了一种从黑箱分类器转向可解释音频深度伪造检测 (explainable audio deepfake detections, ADDs) 的可能路径,通过提供推理痕迹为预测提供一定程度的透明度。这需要一种新的模型鲁棒性分析范式:在对抗攻击下的预测推理鲁棒性,这种范式主要关注最终预测(例如假与真)的转移,而超越了现有的范式。为分析此类推理转移,我们引入了一个 Forensic Auditing 框架,用于评估 ALMs 在三个相互关联维度上的鲁棒性:声学感知、认知连贯性和认知失调。我们的系统分析揭示,显式推理并不总是提升鲁棒性。相反,我们观察到一种分裂:对于表现出稳健声学感知的模型,推理充当防御性「护盾」,保护它们免受对抗攻击;然而对于其他模型,它则造成性能「税负」,尤其是在语言攻击下,导致认知连贯性下降和攻击成功率增加。关键的是,即使在分类失败的情况下,较高的认知失调仍可作为「静默警报」,标记潜在的操纵。总体而言,本工作对推理在 Forensic 音频深度伪造分析中的作用及其漏洞提供了关键评估。
关键词
引用
@article{arxiv.2601.03615,
title = {Analyzing Reasoning Shifts in Audio Deepfake Detection under Adversarial Attacks: The Reasoning Tax versus Shield Bifurcation},
author = {Binh Nguyen and Thai Le},
journal= {arXiv preprint arXiv:2601.03615},
year = {2026}
}
备注
Preprint for ACL 2026 submission