通过线性任务分解实现后门取消学习
机器学习
2025-10-17 v1 计算机视觉与模式识别
摘要
基础模型通过在计算机视觉中实现对多样化任务的广泛泛化而取得了突破,但它们高度易受对抗性扰动和针对性后门攻击的威胁。鉴于模型的大规模本质禁止重新训练以确保安全,现有后门移除方法依赖高昂的微调来覆盖有害行为,常导致其他无关任务性能下降。这引出一个问题:后门能否在不损害模型通用能力的情况下被移除。在本工作中,我们回答了这个问题,研究了后门如何编码在模型权重空间中,发现后门与其他良性任务是解耦的。具体而言,这种分离使我们能够以最小对干净性能影响的方式隔离并擦除后门对模型的影响。基于此洞见,我们引入一种简单的方法,利用这种解耦。通过在 CLIP-based 模型和常见对抗触发器上的大量实验,我们展示在已知攻击的情况下,我们的方法实现约等于完美的取消学习,同时保留平均 96% 的干净准确率。此外,我们展示即使在攻击及其存在未知的情况下,我们的方法也能通过使用反向工程触发器进行适当估计来成功取消学习后门。总体而言,我们的方法在与现有 SOTA 防御措施比较时,持续实现更好的取消学习和干净准确率权衡。
引用
@article{arxiv.2510.14845,
title = {Backdoor Unlearning by Linear Task Decomposition},
author = {Amel Abdelraheem and Alessandro Favero and Gerome Bovet and Pascal Frossard},
journal= {arXiv preprint arXiv:2510.14845},
year = {2025}
}