中文

面向通用音频深度伪造检测的风格-语言学不匹配模型 SLIM

声音 2024-07-29 v1 人工智能 音频与语音处理

摘要

音频深度伪造检测(ADD)是关键技术,用于 combat the misuse of speech synthesized from generative AI models。现有的 ADD 模型存在泛化问题,in-domain 和 out-of-domain 数据之间存在较大性能差异。此外,现有模型的黑箱本质限制了其在实际场景中的使用,其中需要对模型决策提供解释。为缓解这些问题,我们引入一个新的 ADD 模型,该模型显式地使用 fake speech 中的 StyleLInguistics Mismatch(SLIM)来将其与 real speech 分离。SLIM 首先仅在 real samples 上进行自监督预训练,以学习 real class 中的风格-语言学依赖关系。随后,在 standard pretrained acoustic features(如 Wav2vec)中使用所学习的特征来学习 real 和 fake 类别的分类器。当特征编码器被冻结时,SLIM 在 out-of-domain 数据集上优于基准方法,同时在 in-domain 数据上实现具有竞争力的结果。SLIM 学习的特征允许我们量化样本中风格和语言学内容的(不)匹配,从而促进对模型决策的解释。

关键词

引用

@article{arxiv.2407.18517,
  title  = {SLIM: Style-Linguistics Mismatch Model for Generalized Audio Deepfake Detection},
  author = {Yi Zhu and Surya Koppisetti and Trang Tran and Gaurav Bharaj},
  journal= {arXiv preprint arXiv:2407.18517},
  year   = {2024}
}