中文

TranssionADD:一种基于多帧增强的序列标注模型用于音频深度伪造检测

声音 2023-06-28 v1 机器学习 音频与语音处理

摘要

得益于近期端到端语音建模技术的进展,模仿和克隆用户语音已愈发可行。这导致在区分真实与伪造音频片段方面面临重大挑战。为解决用户语音滥用与误用问题,第二届音频深度伪造检测挑战赛(ADD 2023)旨在检测并分析深度伪造语音。具体而言,赛道 2 名为操纵区域定位(RL),旨在精确定位音频中操纵区域的位置,这些区域可同时存在于真实与生成音频片段中。我们提出新颖的 TranssionADD 系统,作为解决轨迹竞赛中模型鲁棒性与音频片段离群值这一难题的方案。我们的系统有三方面独特贡献:1)将序列标注任务应用于音频深度伪造检测;2)通过多种数据增强技术提升模型泛化能力;3)引入多帧检测(MFD)模块以克服单帧表征有限的问题,并使用孤立帧惩罚(IFP)损失处理片段中的离群值。我们的最佳提交在赛道 2 中获得第二名,证明了所提系统的有效性与鲁棒性。

关键词

引用

@article{arxiv.2306.15212,
  title  = {TranssionADD: A multi-frame reinforcement based sequence tagging model for audio deepfake detection},
  author = {Jie Liu and Zhiba Su and Hui Huang and Caiyan Wan and Quanxiu Wang and Jiangli Hong and Benlai Tang and Fengjie Zhu},
  journal= {arXiv preprint arXiv:2306.15212},
  year   = {2023}
}