SPARD:通过相关性-多样性数据选择进行安全投影防御有害微调攻击
机器学习
2026-05-28 v1 人工智能
密码学与安全
摘要
微调大型语言模型常常会削弱其安全对齐效果,这一问题在包含恶意微调攻击的情形下尤为突出,这类攻击会剔除安全措施并诱导不安全行为。我们提出SPARD(Safety-Projected Alternating optimization with Relevance-Diversity Data Selection),一种防御框架,将Safety-Projected Alternating optimization与相关性-多样性数据选择相结合。SPARD采用SPAG(Safety-Projected Alternating optimization),在一组安全数据上交替进行实用性更新和显式安全投影,以强制执行安全约束。为筛选安全数据,我们引入相关性-多样性决定性点过程(Relevance-Diversity Determinantal Point Process),以平衡任务相关性和安全覆盖范围。我们在GSM8K和OpenBookQA数据集上进行了四种恶意微调攻击实验,结果显示SPARD在所有攻击下均实现最低的平均攻击成功率,显著优于最新的防御方法,同时保持高的任务准确率。代码已公开于https://github.com/shuhao02/SPARD。
引用
@article{arxiv.2605.28030,
title = {SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection},
author = {Shuhao Chen and Weisen Jiang and Yeqi Gong and Shengda Luo and Chengxiang Zhuo and Zang Li and James T. Kwok and Yu Zhang},
journal= {arXiv preprint arXiv:2605.28030},
year = {2026}
}
备注
Accepted by ICML 2026