何为真实?语音恢复与声音质量转换为深度伪造检测带来新挑战
声音
2026-03-17 v1 人工智能
机器学习
音频与语音处理
摘要
音频防欺诊系统通常被建模为二分类器,区分bona fide与spoofed语音。这种假设在分层生成处理下不成立,良性转换引入分布性偏移,被误判为欺诈。我们表明,语音共挤改良和语音恢复被视为分布外问题,尽管保持说话人真实性。使用多分类设置区分bona fide、converted、spoofed及converted-spoofed语音,我们通过自监督学习(SSL)嵌入和声学特征分析模型行为。良性转换导致SSL空间漂移,压缩bona fide与spoofed语音,降低分类器可分性。将防欺诊重新建模为多分类问题可提高对良性偏移的鲁棒性,同时保持欺诈检测,表明二分类系统模型的是原始语音的分布而非真实性本身。
引用
@article{arxiv.2603.14033,
title = {What Counts as Real? Speech Restoration and Voice Quality Conversion Pose New Challenges to Deepfake Detection},
author = {Shree Harsha Bokkahalli Satish and Harm Lameris and Joakim Gustafson and Éva Székely},
journal= {arXiv preprint arXiv:2603.14033},
year = {2026}
}
备注
5 pages, 4 figures, 3 tables. Submitted to Interspeech 2026