基于韵律与发音特征的交叉数据集虚假音频检测
声音
2023-05-24 v1 音频与语音处理
摘要
现有的虚假音频检测系统在域内测试中表现良好,但在域外测试中仍面临诸多挑战。这是由于训练与测试数据之间的不匹配,以及从有限视角提取的特征泛化能力较差。为此,我们提出了用于虚假音频检测的多视角特征,旨在从韵律、发音和 wav2vec 维度捕获更具泛化性的特征。具体而言,音素时长特征是从基于大量语音数据预训练的模型中提取的。对于发音特征,首先训练一个基于 Conformer 的音素识别模型,保留其声学编码器部分作为深度嵌入特征提取器。此外,基于注意力机制将韵律与发音特征同 wav2vec 特征融合,以提升虚假音频检测模型的泛化能力。结果表明,所提方法在多个交叉数据集实验中取得了显著的性能提升。
引用
@article{arxiv.2305.13700,
title = {Detection of Cross-Dataset Fake Audio Based on Prosodic and Pronunciation Features},
author = {Chenglong Wang and Jiangyan Yi and Jianhua Tao and Chuyuan Zhang and Shuai Zhang and Xun Chen},
journal= {arXiv preprint arXiv:2305.13700},
year = {2023}
}
备注
Interspeech2023