动态对抗微调重组了拒绝几何
机器学习
2026-05-27 v3 计算与语言
密码学与安全
摘要
安全对齐的语言模型必须在拒绝有害请求时避免过度拒绝,但仍不清楚动态对抗微调如何改变拒绝控制载体:是KL约束方向,还是小维子空间,通过因果干预而不产生大的安全提示分布偏移来调制拒绝。我们研究了7B模型在监督微调(SFT)和Robust Refusal Dynamic Defense(R2D2)下的行为,将其与HarmBench、StrongREJECT和XSTest评估相结合,包括五维几何测量、因果干预和稀疏自适应压力测试。R2D2在早期检查点将固定来源的HarmBench攻击成功率驱动为零;然而,这些检查点也表现出最大的XSTest拒绝,并未通过良好实用性审计。后续检查点部分恢复实用性行为,同时重新打开攻击成功率,适应性GCG攻击成功率在第250步为0.415,第500步为0.613。在内部方面,R2D2在第100步前保持晚层可接受的拒绝控制载体,然后将最佳可接受载体迁移到早期层面;SFT将早期层面迁移得更早,但鲁棒性较差。有效秩约为1.24,SFT显示更大的主角度漂移,反对基于维度扩张和漂移幅度作为充分解释的假设。因果干预支持一种低维但与实用性耦合的载体。这些结果支持R2D2沿着鲁棒性-实用性前沿进行几何重组的账户,而未在适应性鲁棒性上建立。
引用
@article{arxiv.2604.27019,
title = {Dynamic Adversarial Fine-Tuning Reorganizes Refusal Geometry},
author = {Wenhao Lan and Shan Li and Xinhua Lai and Meiqi Wu and Junbin Yang and Haihua Shen and Yijun Yang},
journal= {arXiv preprint arXiv:2604.27019},
year = {2026}
}