基于声学链式思考的深度伪造语音检测音频语言模型
声音
2026-04-01 v2
摘要
深度伪造语音检测系统通常局限于二元分类任务,难以生成可解释的推理或为决策提供情境丰富的解释。这些模型主要提取潜在嵌入用于真实性检测,但未能以有意义的方式利用结构化声学证据,如韵律、频谱和生理特征。本文引入 CoLMbo-DF,一个面向声学链式思考的特征导向音频语言模型,旨在解决上述局限性,通过将结构化低级声学特征的文本表示直接注入模型提示中,使模型的推理依赖于可解释的证据并提高检测准确性。为支持此框架,我们引入了一个配对音频及其链式思考注释的数据集。实验表明,我们的方法在轻量级开源语言模型上训练,显著优于现有的音频语言模型基线,尽管规模较小,这在可解释的深度伪造语音检测方面标志着一个重要进展。
引用
@article{arxiv.2603.28021,
title = {Audio Language Model for Deepfake Detection Grounded in Acoustic Chain-of-Thought},
author = {Runkun Chen and Yixiong Fang and Pengyu Chang and Yuante Li and Massa Baali and Bhiksha Raj},
journal= {arXiv preprint arXiv:2603.28021},
year = {2026}
}