基于ConvNeXt的音频反欺骗神经网络
声音
2022-12-23 v5 计算与语言
音频与语音处理
摘要
随着语音转换和语音合成算法的快速发展,自动说话人验证(ASV)系统易受欺骗攻击。近年来,研究者提出了若干基于手工特征的反欺骗方法。然而,使用手工特征而非原始波形会丢失用于反欺骗的隐式信息。受ConvNeXt在图像分类任务中出色性能的启发,我们改进了ConvNeXt网络架构并提出了一种轻量级端到端反欺骗模型。通过集成通道注意力块并使用focal loss函数,所提模型可聚焦于语音表示中最具信息的子带以及难以分类的困难样本。实验表明,我们提出的系统在ASVSpoof 2019 LA评估数据集上可达到0.64%的等错误率和0.0187的min-tDCF,优于state-of-the-art系统。
引用
@article{arxiv.2209.06434,
title = {ConvNeXt Based Neural Network for Audio Anti-Spoofing},
author = {Qiaowei Ma and Jinghui Zhong and Yitao Yang and Weiheng Liu and Ying Gao and Wing W. Y. Ng},
journal= {arXiv preprint arXiv:2209.06434},
year = {2022}
}
备注
6 pages