Alethia:面向语音深度伪造的基础编码器
声音
2026-05-04 v1 计算与语言
音频与语音处理
摘要
现有的语音深度伪造检测和定位模型高度依赖语音基础模型(SFMs)提取的表示。然而,下游微调已进入收益递减的阶段。本文转向预训练,提出一种新型配方,结合瓶颈掩码嵌入预测与基于流匹配的频谱重建。其结果是 Alethia,首个用于各种语音深度伪造检测和定位任务的基础音频编码器。我们在 5 个不同任务、56 个基准数据集上进行评估,发现 Alethia 在鲁棒性(对真实世界扰动的抵抗力)和零样本 generalization(如歌声深度伪造)方面显著优于最先进的 SFMs。我们还展示了离散目标在掩码标记预测中的局限性,证明了连续嵌入预测和生成式预训练对于捕捉深度伪造痕迹的重要性。
引用
@article{arxiv.2605.00251,
title = {Alethia: A Foundational Encoder for Voice Deepfakes},
author = {Yi Zhu and Brahmi Dwivedi and Jayaram Raghuram and Surya Koppisetti},
journal= {arXiv preprint arXiv:2605.00251},
year = {2026}
}
备注
Accepted to ICML 2026