基于检索增强与配置匹配的零日音频深度伪造检测
声音
2026-01-12 v3
摘要
基于基础模型和大规模训练数据集构建的现代音频深度伪造检测器取得了令人鼓舞的检测性能。然而,它们在应对零日攻击时存在困难,这类攻击中的音频样本是由模型在现有训练数据中未曾见过的新型合成方法生成的。传统方法对检测器进行微调,但在需要快速响应时可能存在问题。本文提出了一种无需训练的检索增强框架,用于零日音频深度伪造检测,该框架利用知识表示和语音配置匹配。在此框架内,我们提出了简单而有效的检索和集成方法,在 DeepFake-Eval-2024 基准测试上达到了与监督基线及其微调对应方法相当的性能,且无需任何额外的模型训练。我们还对语音配置属性进行了消融研究,并通过引入简单且无需训练的融合策略,证明了该框架的跨数据库泛化能力。
引用
@article{arxiv.2509.21728,
title = {Zero-Day Audio DeepFake Detection via Retrieval Augmentation and Profile Matching},
author = {Xuechen Liu and Xin Wang and Junichi Yamagishi},
journal= {arXiv preprint arXiv:2509.21728},
year = {2026}
}