中文

RefusalGuard:面向LLM安全的几何保持精调

机器学习 2026-05-05 v1 人工智能 计算工程、金融与科学 计算与语言 密码学与安全

摘要

针对下游任务进行安全对齐的语言模型进行精调通常会导致拒绝行为的显著退化,使模型易受对抗性滥用。虽然已有研究表明,安全相关特征在模型激活空间中编码为结构化表示,但这些表示在精调期间如何变化以及为何会发生对齐退化仍不为人所了解。本文研究了对齐退化所涉及的表示层机制。我们的分析表明,标准精调会导致安全相关表示发生系统性漂移,扭曲其几何结构,并在任务优化与安全特征之间引入干扰。这些效应共同导致增加有害遵从。针对这些发现,本文提出了REFUSALGUARD,一种在模型适应期保持安全相关结构的表示层精调框架。该方法约束隐藏表示空间中的更新,确保安全中介组件保持稳定,同时允许在补充方向上进行任务特定学习。我们在包括LLaMA、Gemma和Qwen在内的多个模型家族上评估了REFUSALGUARD,针对AdvBench、DirectHarm4和JailbreakBench等对抗性安全基准以及下游实用任务。该方法在保持竞争性任务性能的同时,实现了与基本安全对齐模型相当的攻击成功率,显著优于基线方法。

关键词

引用

@article{arxiv.2605.01913,
  title  = {RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs},
  author = {Sadia Asif and Mohammad Mohammadi Amiri},
  journal= {arXiv preprint arXiv:2605.01913},
  year   = {2026}
}