面向可扩展语音深度伪造检测:细化图注意力机制
声音
2025-07-17 v1 音频与语音处理
摘要
语音转换与文本转语音合成技术的进步使自动说话人验证(ASV)系统更易受欺骗攻击。本文探索对 AASIST 反欺骗架构进行适度的改进。我们采用冻结的 Wav2Vec 2.0 编码器以保留有限数据情境下的自监督语音表征,替换原始图注意力模块为采用异构查询投影的标准多头注意力模块,并以可训练的、情境感知的集成层取代启发式帧段融合方法。经在 ASVspoof 5 语料库上评估,本文提出的系统实现了 7.6% 的相等错误率(EER),在相同训练条件下优于重新实现的 AASIST 基线。消融实验表明,每一项架构调整均对整体性能有所贡献,表明针对既定模型进行精准化改动可有助于提升实际场景中的语音深度伪造检测能力。代码已公开于 https://github.com/KORALLLL/AASIST_SCALING。
引用
@article{arxiv.2507.11777,
title = {Towards Scalable AASIST: Refining Graph Attention for Speech Deepfake Detection},
author = {Ivan Viakhirev and Daniil Sirota and Aleksandr Smirnov and Kirill Borodin},
journal= {arXiv preprint arXiv:2507.11777},
year = {2025}
}