面向语音深度伪造检测的Audio LLM中的显式声学证据感知
声音
2026-02-02 v1 人工智能
摘要
语音深度伪造检测(SDD)旨在识别给定语音信号是真实的还是合成的。现有的基于语音大语言模型(LLM)的方法在内容理解方面表现出色,但其预测常偏向于语义相关线索,导致在决策过程中忽略细粒度声学artifacts。因此,即使语义自然的假语音虽含有细微的声学异常,仍可能被检测器误判为真实。这表明挑战并非缺乏声学数据,而是语义主导推理下声学数据的可及性不足。为此,我们在语音LLM范式中探讨SDD,引入SDD with Auditory Perception-enhanced Audio Large Language Model(SDD-APALLM),一个旨在显式暴露细粒度时频证据作为可访问声学线索的框架。通过将原始音频与结构化频谱图相结合,该框架使音频LLM能够更有效地捕捉细微的声学不一致,而不牺牲其语义理解能力。实验结果表明,在语义线索误导的情况下,检测准确率和鲁棒性均得到一致提升。进一步分析表明,这些改进源于语义与声学信息的协同利用,而非简单的模态聚合。
引用
@article{arxiv.2601.23066,
title = {Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection},
author = {Xiaoxuan Guo and Yuankun Xie and Haonan Cheng and Jiayi Zhou and Jian Liu and Hengyan Huang and Long Ye and Qin Zhang},
journal= {arXiv preprint arXiv:2601.23066},
year = {2026}
}
备注
9 pages, 4 figures