中文

我为人人,人人为我:基于深度学习的特征融合用于合成语音检测

声音 2023-07-31 v1 计算与语言 密码学与安全 音频与语音处理

摘要

深度学习和计算机视觉的最新进展使得多媒体内容的合成与伪造比以往任何时候都更容易,从而导致来自恶意用户的潜在威胁与危险。在音频领域,我们正目睹语音深度伪造生成技术的增长,这促使了合成语音检测算法的发展,以对抗诸如欺诈或身份盗用等可能的恶意用途。在本文中,我们考虑文献中提出的三种不同的特征集用于合成语音检测任务,并提出了一种融合它们的模型,相对于最先进(state-of-the-art)方案取得了整体更优的性能。该系统在不同场景与数据集上进行了测试,以证明其对抗反取证(anti-forensic)攻击的鲁棒性及其泛化能力。

关键词

引用

@article{arxiv.2307.15555,
  title  = {All-for-One and One-For-All: Deep learning-based feature fusion for Synthetic Speech Detection},
  author = {Daniele Mari and Davide Salvi and Paolo Bestagini and Simone Milani},
  journal= {arXiv preprint arXiv:2307.15555},
  year   = {2023}
}

备注

Accepted at ECML-PKDD 2023 Workshop "Deep Learning and Multimedia Forensics. Combating fake media and misinformation"