AlignGuard-LoRA:基于Fisher引导分解和黎曼-测地碰撞正则化的对齐保持微调
机器学习
2025-08-05 v1 人工智能
摘要
低秩适应 (LoRA) 已成为高效微调大型语言模型 (LLM) 的标准工具。然而,即使是轻微的 LoRA 更新也会导致对齐漂移,通过交织的参数变化削弱了安全和行为约束。为此,我们提出AlignGuard-LoRA (AGL),一个原则化的框架,用于在微调期间保持对齐。AGL 引入了若干关键组件:用于监督的主要任务损失、基于Fisher 信息矩阵的正则化以限制对齐敏感子空间的更新,以及用于稳定新知识集成的任务特定正则化。我们进一步引入感知碰撞的正则化,将黎曼重叠——对坐标级干扰进行惩罚——与测地分离——鼓励更新几何具有不相交性——相结合。我们构建了DriftCaps,一个针对性诊断基准,包含安全与不安全提示,用于量化对齐漂移和安全降解。实证评估表明,AGL 在安全关键基准上可将对齐漂移降低最高50%,且不会损害下游任务性能。综合消融实验确认,每个组件都对保持潜在安全行为贡献突出。最后,我们推导并验证了灾难性遗忘的比例定律,揭示AGL 在保持适应动力学的同时平抑了微调后损失的上升。AGL 是LoRA 的一种结构性改进,确保以最小的权衡实现对齐保持。为鼓励进一步的探索与发展,我们开源了我们的实现。
关键词
引用
@article{arxiv.2508.02079,
title = {AlignGuard-LoRA: Alignment-Preserving Fine-Tuning via Fisher-Guided Decomposition and Riemannian-Geodesic Collision Regularization},
author = {Amitava Das and Abhilekh Borah and Vinija Jain and Aman Chadha},
journal= {arXiv preprint arXiv:2508.02079},
year = {2025}
}