ROKA:对抗环境下的稳健知识遗忘
机器学习
2026-03-03 v1 人工智能
摘要
机器遗忘的需求对于数据隐私至关重要,但现有方法常常会导致知识污染,不经意地损坏相关知识。此类遗忘后模型性能下降的现象,最近被用于新的推理和后门攻击。大多数研究设计需要投毒或复制训练数据的对抗遗忘请求。本研究引入了一种新的遗忘诱导攻击模型,即间接遗忘攻击(indirect unlearning attack),它不需要数据操纵,却利用知识污染的后果来扰动对安全关键预测的模型准确率。为缓解此类攻击,我们提出了一种理论框架,将神经网络建模为神经知识系统(Neural Knowledge Systems)。基于此,我们提出了ROKA(Robust unlearning with Knowledge Alignment),一种以神经修复(Neural Healing)为核心的稳健遗忘策略。与传统遗忘方法仅破坏信息不同,ROKA通过抵消被遗忘数据的影响,同时加强其概念邻居来进行建构性重平衡。到目前为止,我们的工作是首次为遗忘期间的知识保留提供了理论保证。在各种大型模型(包括视觉变换器、多模态模型和大语言模型)上的评估表明,ROKA有效地遗忘目标,同时保持或甚至提高保留数据的准确率,从而缓解了间接遗忘攻击。
引用
@article{arxiv.2603.00436,
title = {ROKA: Robust Knowledge Unlearning against Adversaries},
author = {Jinmyeong Shin and Joshua Tapia and Nicholas Ferreira and Gabriel Diaz and Moayed Daneshyari and Hyeran Jeon},
journal= {arXiv preprint arXiv:2603.00436},
year = {2026}
}