面向对抗性音频分类的通道特征自适应重标定
声音
2022-10-24 v1 人工智能
音频与语音处理
摘要
与 DeepFake 图像和视频不同,DeepFake 音频从检测角度受到的关注相对较少,而现有用于合成语音分类的解决方案要么使用复杂网络,要么无法泛化到利用不同生成与基于优化的方法所获得的各类合成语音。通过本工作,我们提出一种利用注意力特征融合进行通道级特征重标定的合成语音检测方法,并将其性能与包括 End2End 模型和基于 Resnet 的模型在内的不同检测方法在由 Text to Speech 与 WaveNet、WaveRNN、Tactotron、WaveGlow 等声码器系统生成的合成语音上进行比较。我们还在基于 Resnet 的模型中试验了 Squeeze Excitation (SE) 块,发现该组合能够获得更好的性能。除分析外,我们还证明使用注意力特征融合技术将线性频率倒谱系数 (LFCC) 与梅尔频率倒谱系数 (MFCC) 相结合可创建更好的输入特征表示,从而帮助即便更简单的模型也能很好地泛化于合成语音分类任务。我们的模型(采用特征融合的基于 Resnet 的模型)在 Fake or Real (FoR) 数据集上训练,在 FoR 数据上取得了 95% 的测试准确率,在采用该框架后由不同生成模型生成的样本上取得了平均 90% 的准确率。
引用
@article{arxiv.2210.11722,
title = {Adaptive re-calibration of channel-wise features for Adversarial Audio Classification},
author = {Vardhan Dongre and Abhinav Thimma Reddy and Nikhitha Reddeddy},
journal= {arXiv preprint arXiv:2210.11722},
year = {2022}
}
备注
7 pages, 8 figures, 4 tables