马克henko 合并,后悔更晚:模型合并的隐性成本——对抗性可迁移性
机器学习
2025-09-30 v1
摘要
模型合并(MM)已成为一种新兴的多任务学习替代方案,其中将多个微调模型合并而无需访问任务训练数据,即可保持跨任务性能。近期研究探讨了MM对对抗攻击影响,尤其是后门攻击,但尚未充分考察其对基于对抗样本的迁移攻击的影响,即黑盒对抗攻击中为替代模型生成的样本能否误导目标模型。在本工作中,我们研究了MM对对抗样本可迁移性的影响。我们进行了全面的评估和统计分析,涵盖8种MM方法、7个数据集和6种攻击方法,覆盖336种不同的攻击场景。通过这些实验,我们首次挑战了MM“免费”对抗鲁棒性的普遍观念,表明MM无法可靠地防御迁移攻击,迁移攻击成功率高达95%以上。此外,我们揭示了针对机器学习从业者的3个关键见解,涉及MM与可迁�性问题:(1)更强的MM方法会增加对迁移攻击的脆弱性;(2)缓解表示偏差会增加对迁移攻击的脆弱性;(3)尽管权重平均是最弱的MM方法,却是对迁移攻击最脆弱的MM方法。最后,我们分析了这种脆弱性增加的根本原因,并提供了可能的解决方案。我们的发现为设计更安全的采用MM的系统提供了关键见解。
引用
@article{arxiv.2509.23689,
title = {Merge Now, Regret Later: The Hidden Cost of Model Merging is Adversarial Transferability},
author = {Ankit Gangwal and Aaryan Ajay Sharma},
journal= {arXiv preprint arXiv:2509.23689},
year = {2025}
}