使用非语义表示的可泛化音频欺骗检测
声音
2025-09-03 v1 人工智能
音频与语音处理
摘要
生成式模型的快速发展使得合成音频的生成变得容易,从而使基于语音的服务容易受到欺骗攻击。因此,对稳健对策的需求比以往任何时候都更加迫切。现有的 deepfake 检测解决方案常因缺乏泛化能力而受到批评,在应用于真实世界数据时往往会彻底失败。本研究提出了一种利用非语义通用音频表示的新颖方法,用于可泛化的欺骗检测。我们使用 TRILL 和 TRILLsson 模型进行了大量实验,以寻找合适的非语义特征。结果表明,所提出的方法在领域内测试集上取得了可比的性能,同时在领域外测试集上显著优于 SOTA 方法。值得注意的是,该方法在公共领域数据上展现出卓越的泛化能力,超越了基于手工特征、语义嵌入和端到端架构的方法。
引用
@article{arxiv.2509.00186,
title = {Generalizable Audio Spoofing Detection using Non-Semantic Representations},
author = {Arnab Das and Yassine El Kheir and Carlos Franzreb and Tim Herzig and Tim Polzehl and Sebastian Möller},
journal= {arXiv preprint arXiv:2509.00186},
year = {2025}
}