TriGuard:基于归因熵、验证与漂移的模型安全测试框架
机器学习
2025-06-18 v1 人工智能
摘要
深度神经网络常以高精度著称,但在对抗性攻击和分布迁移情况下的可靠性仍是亟待解决的挑战。我们提出了 TriGuard——一个统一的安全评估框架,集成了 (1) 形式化鲁棒性验证、(2) 基于归因熵的显著性集中度量,以及 (3) 一种新颖的归因漂移得分(Attribution Drift Score)用于衡量解释稳定性。TriGuard 揭示了模型准确性与可解释性之间的关键矛盾:经验证的模型仍可能表现出不稳定的推理过程,归因方法提供的信号为对抗准确率之外的额外安全洞察。通过三个数据集和五种网络结构的大量实验表明,TriGuard 能揭示神经推理中微妙的脆弱性。我们进一步展示了熵正则化训练可在不牺牲性能的前提下降低解释漂移。TriGuard 推动了鲁棒且可解释模型评估的前沿发展。
引用
@article{arxiv.2506.14217,
title = {TriGuard: Testing Model Safety with Attribution Entropy, Verification, and Drift},
author = {Dipesh Tharu Mahato and Rohan Poudel and Pramod Dhungana},
journal= {arXiv preprint arXiv:2506.14217},
year = {2025}
}
备注
12 pages, 6 tables, 6 figures