中文

异质性优于同质性:研究用于检测音频深度伪造的多语言语音预训练模型

音频与语音处理 2024-04-02 v1

摘要

在这项工作中,我们研究了用于音频深度伪造检测 (ADD) 的多语言语音预训练模型 (PTM)。我们假设在大规模多样化多语言数据上训练的多语言 PTM 在其预训练阶段获得了关于不同音高、口音和语调的知识,从而使它们对变化更具鲁棒性。因此,它们在检测音频深度伪造方面将更为有效。为了验证我们的假设,我们从最先进的 (SOTA) PTM 中提取表示,包括单语、多语言以及为说话人和情感识别训练的 PTM,并在 ASVSpoof 2019 (ASV)、In-the-Wild (ITW) 和 DECRO 基准数据库上对其进行评估。我们表明,与其他 PTM 表示相比,来自多语言 PTM 的表示通过简单的下游网络在 ADD 中获得了最佳性能,这验证了我们的假设。我们还探索了融合选定 PTM 表示以进一步改进 ADD 的可能性,并为此提出了一个框架 MiO (Merge into One)。借助 MiO,我们在 ASV 和 ITW 上实现了 SOTA 性能,并在 DECRO 上取得了与当前 SOTA 工作相当的性能。

关键词

引用

@article{arxiv.2404.00809,
  title  = {Heterogeneity over Homogeneity: Investigating Multilingual Speech Pre-Trained Models for Detecting Audio Deepfake},
  author = {Orchid Chetia Phukan and Gautam Siddharth Kashyap and Arun Balaji Buduru and Rajesh Sharma},
  journal= {arXiv preprint arXiv:2404.00809},
  year   = {2024}
}

备注

Accepted to NAACL (Findings) 2024