中文

音频深度伪造的攻击者溯源

密码学与安全 2022-03-30 v1 机器学习 声音

摘要

深度伪造是以恶意意图合成的媒体内容。随着大型训练数据集与先进神经网络的发展,它们已变得愈发逼真。这些伪造物正被轻易滥用于诽谤、误导信息与欺诈。因此,开发对策的密集研究也在扩展。然而,近期工作几乎仅限于深度伪造检测——预测音频为真或假。尽管溯源(谁创建了哪些伪造物?)作为更宏大防御策略的基本构件,在网络安全领域长期实践中不可或缺,但相关研究工作却寥寥无几。本文考虑音频领域的深度伪造攻击者溯源问题。我们提出了几种利用底层声学描述子与机器学习嵌入来创建攻击者签名的方法。我们表明语音信号特征不足以刻画攻击者签名。不过,我们也证明来自循环神经网络的嵌入能成功刻画来自已知与未知攻击者的攻击。我们的攻击签名嵌入形成了 distinct 的簇,无论对于已见还是未见的音频深度伪造皆然。我们展示了这些嵌入可用于下游任务且效果显著,在攻击者身份分类中取得97.10%的准确率。

关键词

引用

@article{arxiv.2203.15563,
  title  = {Attacker Attribution of Audio Deepfakes},
  author = {Nicolas M. Müller and Franziska Dieckmann and Jennifer Williams},
  journal= {arXiv preprint arXiv:2203.15563},
  year   = {2022}
}

备注

Submitted to Insterspeech 2022