HM-Conformer:一种基于 Conformer 并采用分层池化与多级分类令牌聚合方法的音频深度伪造检测系统
声音
2023-09-18 v1 密码学与安全
机器学习
音频与语音处理
摘要
音频深度伪造检测(ADD)是检测由文本转语音或语音转换系统生成的欺骗攻击的任务。有助于区分伪造与真实语音的欺骗证据可能存在于输入特征的局部或全局中。为此,由 Transformer 与 CNN 构成的 Conformer 具备合适的结构。然而,由于 Conformer 是为序列到序列任务设计的,其直接应用于 ADD 任务可能并非最优。为应对此局限,我们提出 HM-Conformer,采用两个组件:(1) 分层池化方法逐步缩减序列长度以消除冗余信息;(2) 多级分类令牌聚合方法利用分类令牌从不同块中收集信息。借助这些组件,HM-Conformer 可通过处理不同序列长度并聚合它们来高效检测欺骗证据。在 ASVspoof 2021 Deepfake 数据集上的实验结果表明,HM-Conformer 取得了 15.71% 的 EER,与近期系统相比具有竞争力。
引用
@article{arxiv.2309.08208,
title = {HM-Conformer: A Conformer-based audio deepfake detection system with hierarchical pooling and multi-level classification token aggregation methods},
author = {Hyun-seo Shin and Jungwoo Heo and Ju-ho Kim and Chan-yeong Lim and Wonbin Kim and Ha-Jin Yu},
journal= {arXiv preprint arXiv:2309.08208},
year = {2023}
}
备注
Submitted to 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP 2024)