中文

ELEAT-SAGA:基于逃逸交替训练的早晚集成防欺唤 speaker verification

音频与语音处理 2026-02-17 v1

摘要

防欺唤自动说话人验证(SASV)旨在构建对零效应欺骗攻击和语音转换(VC)、文本转语音(TTS)等高级欺骗技术具有鲁棒性的系统。本文提出一种新型SASV架构,引入基于得分感知的门控注意力机制(SAGA),SASV-SAGA 能够根据反欺唤得分动态调制说话人嵌入。通过集成来自 ECAPA-TDNN 和 AASIST 的说话人嵌入和反欺唤得分,我们探索了包括早期、晚期和完整集成在内的多种集成策略。我们进一步引入多模块交替训练(ATMM)及其改进方案逃逸式交替训练(EAT)。在ASVspoof 2019 逻辑访问(LA)和 Spoofceleb 数据集上进行的实验表明,我们的方法在基线上显著提升,ASVspoof 2019 评估集上的 SASV-EER 达到 1.22%,最小归一化中性检测代价函数(min a-DCF)达到 0.0304。这些结果确认了基于得分感知注意力机制和交替训练策略在增强 SASV 系统鲁棒性方面的有效性。

关键词

引用

@article{arxiv.2602.13761,
  title  = {ELEAT-SAGA: Early & Late Integration with Evading Alternating Training for Spoof-Robust Speaker Verification},
  author = {Amro Asali and Yehuda Ben-Shimol and Itshak Lapidot},
  journal= {arXiv preprint arXiv:2602.13761},
  year   = {2026}
}