刻画通用语音表征的时序动态以实现可泛化深度伪造检测
声音
2023-09-18 v1 计算与语言
音频与语音处理
摘要
现有深度伪造语音检测系统对未见攻击(即训练时未见的生成算法生成的样本)缺乏泛化能力。近期研究探索使用通用语音表征解决此问题并取得了鼓舞人心的结果。然而,这些工作聚焦于创新下游分类器,而未触及表征本身。本研究中,我们认为刻画这些表征的长期时序动态对泛化能力至关重要,并提出一种评估表征动态的新方法。事实上,我们表明不同生成模型用我们提出的方法生成相似的表征动态模式。在 ASVspoof 2019 与 2021 数据集上的实验验证了所提方法在检测训练时未见方法产生的深度伪造方面的益处,显著优于若干基准方法。
引用
@article{arxiv.2309.08099,
title = {Characterizing the temporal dynamics of universal speech representations for generalizable deepfake detection},
author = {Yi Zhu and Saurabh Powar and Tiago H. Falk},
journal= {arXiv preprint arXiv:2309.08099},
year = {2023}
}
备注
Submitted to ICASSP 2024