QAMO:面向语音深度伪造检测的质量感知多质心单类学习
声音
2025-09-26 v1 人工智能
摘要
近期研究表明,单类学习可以通过围绕单个质心建模真实语音的紧凑分布来检测未见过的深度伪造攻击。然而,单质心假设可能过度简化真实语音的表示,并忽略有用的线索,如语音质量,它反映了语音的自然度。语音质量可以通过现有的语音质量评估模型,通过平均意见得分(Mean Opinion Score)轻松获得。在本文中,我们提出了 QAMO:面向语音深度伪造检测的质量感知多质心单类学习。QAMO 通过引入多个质量感知质心扩展了传统的单类学习。在 QAMO 中,每个质心被优化以表示不同的语音质量子空间,从而更好地建模真实语音内的类内变异。此外,QAMO 支持多质心集成评分策略,该策略改进了决策阈值设定,并减少了推理过程中对质量标签的需求。通过两个质心分别表示高质量和低质量语音,我们提出的 QAMO 在 In-the-Wild 数据集上实现了 5.09% 的等错误率,超越了之前的单类和质量感知系统。
引用
@article{arxiv.2509.20679,
title = {QAMO: Quality-aware Multi-centroid One-class Learning For Speech Deepfake Detection},
author = {Duc-Tuan Truong and Tianchi Liu and Ruijie Tao and Junjie Li and Kong Aik Lee and Eng Siong Chng},
journal= {arXiv preprint arXiv:2509.20679},
year = {2025}
}
备注
5 pages, 4 figures