中文

MFAAN:以多特征真实性网络揭示音频深度伪造

声音 2024-02-28 v1 人工智能 音频与语音处理

摘要

在当代数字时代,深度伪造的泛滥对信息传播的可信性构成了严峻挑战。尤其是音频深度伪造可具有欺骗性的真实感,在虚假信息活动中带来重大风险。为应对此威胁,我们引入了多特征音频真实性网络(MFAAN),一种专为检测伪造音频内容而设计的先进架构。MFAAN 包含多条并行路径,旨在利用不同音频表示的优势,包括梅尔频率倒谱系数(MFCC)、线性频率倒谱系数(LFCC)和色度短时傅里叶变换(Chroma-STFT)。通过协同融合这些特征,MFAAN 实现对音频内容的细致理解,促进对真实与篡改录音的鲁棒区分。MFAAN 在两个基准数据集——'In-the-Wild' 音频深度伪造数据与 Fake-or-Real 数据集上的初步评估显示了其优越性能,分别达到 98.93% 和 94.47% 的准确率。此类结果不仅凸显了 MFAAN 的有效性,也表明其作为对抗深度伪造音频内容持续斗争中的关键工具的潜力。

关键词

引用

@article{arxiv.2311.03509,
  title  = {MFAAN: Unveiling Audio Deepfakes with a Multi-Feature Authenticity Network},
  author = {Karthik Sivarama Krishnan and Koushik Sivarama Krishnan},
  journal= {arXiv preprint arXiv:2311.03509},
  year   = {2024}
}