基于贝叶斯数据调度器的大语言模型有害微调自适应防御
机器学习
2025-11-03 v1 人工智能
摘要
有害微调构成大语言模型微调即服务的关键安全风险。现有防御策略通过攻击模拟预先构建鲁棒性,但存在根本性局限:(i) 由于难以预见未知攻击,无法将攻击模拟扩展到受限之外的威胁模型;(ii) 由于模拟无法捕捉其变数和复杂性,适应性有限。为解决这些挑战,我们提出贝叶斯数据调度器 (BDS),一种无需攻击模拟的自适应调优阶段防御策略。BDS 将有害微调防御表述为贝叶斯推断问题,学习每个数据点安全属性的后验分布,条件化于微调和对齐数据集。随后通过对数据进行加权(基于从后验中抽样的安全属性),以约束微调过程,从而减轻有害数据的影响。通过利用贝叶斯推断的事后性质,后验条件化于微调数据集,使 BDS 能够针对特定数据集定制其防御,从而实现自适应防御。此外,我们引入基于 amortized 贝叶斯学习的神经调度器,实现对新数据的高效迁移,无需重新训练。广泛的实验结果表明,我们的方法在 diverse attack 与 defense 设置下实现了最先进的性能。代码可在 https://github.com/Egg-Hu/Bayesian-Data-Scheduler 获取。
引用
@article{arxiv.2510.27172,
title = {Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler},
author = {Zixuan Hu and Li Shen and Zhenyi Wang and Yongxian Wei and Dacheng Tao},
journal= {arXiv preprint arXiv:2510.27172},
year = {2025}
}