中文

面向深度伪造音频的开集模型归因的拒绝阈值自适应

声音 2024-12-03 v1 人工智能 音频与语音处理

摘要

面向开放环境的开集模型归因是深度伪造音频的新兴研究主题,旨在识别深度伪造音频的生成模型。大多数先前工作需要手动设置拒绝阈值以与预测概率进行比较。然而,模型常过拟合训练实例,生成过于自信的预测。此外,当前数据集中有效区分未知类别的阈值可能不适用于识别另一个数据分布中的已知和未知类别。为此,本文提出了一种基于拒绝阈值自适应(ReTA)的深度伪造音频开集模型归因框架。具体而言,重建误差学习模块通过结合系统指纹表示与目标类别或随机选择的其他类别标签来训练,从而生成匹配和非匹配的重建样本,建立每个类别的重建误差分布,为拒绝阈值计算模块奠定基础。拒绝阈值计算模块利用高斯概率估计拟合匹配和非匹配重建误差的分布,然后通过概率最小化准则计算所有类别的自适应拒绝阈值。实验结果表明,ReTA 在提高深度伪造音频的开集模型属性方面有效。

关键词

引用

@article{arxiv.2412.01425,
  title  = {Reject Threshold Adaptation for Open-Set Model Attribution of Deepfake Audio},
  author = {Xinrui Yan and Jiangyan Yi and Jianhua Tao and Yujie Chen and Hao Gu and Guanjun Li and Junzuo Zhou and Yong Ren and Tao Xu},
  journal= {arXiv preprint arXiv:2412.01425},
  year   = {2024}
}

备注

Accepted by ISCSLP 2024