准确率不够:通过颜色偏移破坏联邦学习中的可解释性
计算机视觉与模式识别
2025-11-19 v2
摘要
随着机器学习模型在安全关键领域的部署增多,视觉解释技术日益成为支持透明度的重要工具。本文揭示了一类新型攻击,这些攻击在不影响准确率的情况下破坏模型的可解释性。具体而言,我们展示了在联邦学习环境中,由对抗性客户端施加的微小颜色扰动可导致模型的显著图图(saliency maps)偏离语义上有意义的区域,而保持预测结果不变。我们提出的以显著性为导向的攻击框架,称为 Chromatic Perturbation Module,通过改变前景与背景之间的颜色对比度来系统性地构建对抗性样本,从而破坏解释保真度。这些扰动在训练轮次中累积,以隐蔽且持久的方式污染全局模型的内部特征归因。我们的发现挑战了一种常见假设,即正确的预测意味着忠实的解释,并表明可解释性本身可能成为攻击面。我们在多个数据集上评估了该漏洞,表明标准训练管道不足以检测或缓解解释性能降低,尤其是在联邦学习环境中,微小的颜色扰动更难被察觉。本次攻击在保持所有评估数据集上分类准确率高于 96% 的情况下,将 Grad-CAM 解释的峰值激活重叠度降低至最高 35%。
引用
@article{arxiv.2511.13535,
title = {Accuracy is Not Enough: Poisoning Interpretability in Federated Learning via Color Skew},
author = {Farhin Farhad Riya and Shahinul Hoque and Jinyuan Stella Sun and Olivera Kotevska},
journal= {arXiv preprint arXiv:2511.13535},
year = {2025}
}