SNAP:语音深度伪造检测中的说话人空化
声音
2026-03-24 v1 人工智能
摘要
近期文本转语音技术的进展使得合成语音几乎难以与真实人类语音区分。虽然近期研究表明自监督学习语音编码器在深度伪造检测中有效,但这些模型在未见说话人之间难以泛化。我们的定量分析表明,这些编码器表示受说话人信息显著影响,导致检测器依赖说话人特定关联,而非与伪造相关的线索。我们称之为说话人 entangled 现象。为缓解这种依赖,我们引入 SNAP 框架。我们估计说话人子空间并应用正交投影以抑制说话人相关分量,从而隔离合成伪造的残差特征。通过减少说话人 entangled,SNAP鼓励检测器关注伪造相关模式,实现了最好的性能。
引用
@article{arxiv.2603.20686,
title = {SNAP: Speaker Nulling for Artifact Projection in Speech Deepfake Detection},
author = {Kyudan Jung and Jihwan Kim and Minwoo Lee and Soyoon Kim and Jeonghoon Kim and Jaegul Choo and Cheonbok Park},
journal= {arXiv preprint arXiv:2603.20686},
year = {2026}
}
备注
9 pages, 3 figures, 2 tables