解读多分支防欺架构:关联内部策略与实证绩效
声音
2026-04-23 v3 音频与语音处理
摘要
多分支深度神经网络如 AASIST3 在音频防欺 spoofing 中实现了与传统输入级显著性方法相比的领先绩效,但其内部决策动力学仍不为人知。虽然已有解释性工作主要聚焦于可视化输入人工,但不同欺骗攻击下各构建分支如何合作或竞争尚未得到充分刻画。本文构建一个用于解释 AASIST3 组件层面的框架。通过建模十四个分支和全局注意力模块的中间激活,使用协方差算子,其领先特征根构成低维谱签名。这些签名训练 CatBoost 元分类器生成 TreeSHAP 基于分支的归因,从而转换为归一化贡献份额与置信度分数(Cb),以量化模型的运行策略。通过分析 ASVspoof 2019 基准中的十三种欺骗攻击,我们识别出四种运行原型:从有效专化(如 A09,错误率为 0.04%,C=1.56)到无效共识(如 A08,错误率为 3.14%,C=0.33)。关键地,我们的分析揭示了一种有缺陷的专化模式,其中模型在错误分支上置于高置信度,导致针对攻击 A17 与 A18(错误率分别为 14.26% 与 28.63%)的绩效严重下降。这些定量发现将内部建构策略直接关联到实证可靠性,凸显了常规绩效指标所忽视的特定结构依赖性。
引用
@article{arxiv.2602.17711,
title = {Interpreting Multi-Branch Anti-Spoofing Architectures: Correlating Internal Strategy with Empirical Performance},
author = {Ivan Viakhirev and Kirill Borodin and Mikhail Gorodnichev and Grach Mkrtchian},
journal= {arXiv preprint arXiv:2602.17711},
year = {2026}
}
备注
Published at MDPI Mathematics (see at https://www.mdpi.com/2227-7390/14/2/381)