中文

漏洞感知对齐:缓解有害微调中的不均匀遗忘

机器学习 2025-08-13 v2

摘要

有害微调(HFT)直接在开源大语言模型或通过微调即服务上进行,会破坏安全对齐并构成重大威胁。现有方法旨在通过对对齐数据学习鲁棒表示或使有害数据不可学习来缓解HFT风险,但它们对所有数据样本一视同仁,导致数据脆弱性模式未被充分研究。在本工作中,我们揭示了对齐数据的某些子集在不同的微调任务中始终更容易被遗忘。受这些发现的启发,我们提出了漏洞感知对齐(VAA),该方法估计数据脆弱性,将数据划分为"脆弱"和"不脆弱"两组,并通过组分布鲁棒优化(Group DRO)框架鼓励平衡学习。具体而言,VAA学习一个对抗采样器,从当前表现较差的组中采样样本,然后在训练期间对数据施加组依赖的对抗扰动,旨在鼓励跨组的平衡学习过程。在四个微调任务上的实验表明,VAA显著降低了有害分数,同时保持了下游任务性能,优于最先进的基线方法。

关键词

引用

@article{arxiv.2506.03850,
  title  = {Vulnerability-Aware Alignment: Mitigating Uneven Forgetting in Harmful Fine-Tuning},
  author = {Liang Chen and Xueting Han and Li Shen and Jing Bai and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:2506.03850},
  year   = {2025}
}

备注

ICML 2025