基于 Poincaré 球体的层次结构学习与特征白化的通用音频深度伪造检测
声音
2025-08-05 v1 音频与语音处理
摘要
音频深度伪造检测 (ADD) 面临由于多样化的现实世界欺骗攻击和领域变化导致的泛化挑战。然而,现有方法主要依赖欧几里得距离,未能充分捕捉与攻击类别和领域因素相关的内在层次结构。为此,我们设计了 novel 框架 Poin-HierNet 在 Poincaré 球体中构建领域不变的层次表示。Poin-HierNet 包括三个关键组件:1) Poincaré 原型学习 (PPL) 包含多个数据原型对齐样本特征并捕捉超越人类标签的多级层次结构;2) 层次结构学习 (HSL) 利用顶级原型建立自数据原型的树状层次结构;3) Poincaré 特征白化 (PFW) 通过应用特征白化来抑制领域敏感特征以实现领域不变性。我们在四个数据集上评估了该方法:ASVspoof 2019 LA、ASVspoof 2021 LA、ASVspoof 2021 DF 和 In-The-Wild。实验结果表明,Poin-HierNet 在等错误率 (EER) 上超越了当前最先进的方法。
引用
@article{arxiv.2508.01897,
title = {Generalizable Audio Deepfake Detection via Hierarchical Structure Learning and Feature Whitening in Poincar\'e sphere},
author = {Mingru Yang and Yanmei Gu and Qianhua He and Yanxiong Li and Peirong Zhang and Yongqiang Chen and Zhiming Wang and Huijia Zhu and Jian Liu and Weiqiang Wang},
journal= {arXiv preprint arXiv:2508.01897},
year = {2025}
}
备注
Accepted for publication on Interspeech 2025