深层状态空间模型对抗鲁棒性探索
机器学习
2024-10-10 v2 人工智能
摘要
深层状态空间模型(SSMs)在诸多任务场景中已被证明有效,但由于对抗性扰动(AP)在实际部署中面临重大安全挑战。 对抗性训练(AT)是增强对抗鲁棒性(AR)的主流方法,已在各种传统深度神经网络架构上得到验证。 然而,其在提高SSMs鲁棒性方面的效果尚不明确。 虽然许多SSMs组件的改进,如整合注意力机制和扩展为数据依赖的SSM参数化,都在标准训练(ST)设置下带来了显著性能提升,但其在AT中的潜在益处仍未探索。 为了探讨这一问题,我们评估了现有SSMs结构变体并进行AT,以评估其AR性能。 我们观察到,纯粹的SSM结构难以从AT中获益,而将注意力集成到SSMs中可在AT中实现鲁棒性和泛化性之间的显著权衡。 然而,注意力整合也会导致鲁棒性过拟合(RO)问题。 为了理解这些现象,我们对SSMs在AP下的输出误差进行经验和理论分析。 我们发现,固定参数化的SSMs在输出误差上存在严格限制,其参数限制了AT的益处,而输入依赖的SSMs可能面临误差爆炸问题。 此外,我们表明注意力组件在训练期间有效放大SSMs的输出误差,使其能从AT中获益,但会因模型复杂度高而引入RO。 受此启发,我们提出一种简单且有效的自适应缩放(AdS)机制,使AT性能接近注意力集成SSMs,却不引入RO问题。 我们的代码已公开:https://github.com/Biqing-Qi/Exploring-Adversarial-Robustness-of-Deep-State-Space-Models.git。
引用
@article{arxiv.2406.05532,
title = {Exploring Adversarial Robustness of Deep State Space Models},
author = {Biqing Qi and Yang Luo and Junqi Gao and Pengfei Li and Kai Tian and Zhiyuan Ma and Bowen Zhou},
journal= {arXiv preprint arXiv:2406.05532},
year = {2024}
}
备注
Accepted to NeurIPS 2024