剔除不安全票票:更安全更稳健 LLM 的资源高效框架
机器学习
2026-04-20 v1 计算与语言
摘要
机器学习模型日益部署于实际应用中,但即便是对齐后的模型如 Mistral 和 LLaVA 仍表现出源于预训练的不安全行为。当前的对齐方法如 SFT 和 RLHF 主要鼓励模型生成偏好响应,但未明确移除触发有害输出的不安全子网络。本文引入一种资源高效的修剪框架,直接识别并移除与不安全行为相关的参数,同时保留模型实用性。该方法采用无梯度归因机制,仅需 modest GPU 资源,跨架构和量化变体均适用。实证评估表明,模型在生成不安全内容方面显著减少,针对越狱攻击的鲁棒性得到提升,同时实用性损失最小。从彩票假设的视角看,本结果表明机器学习模型包含负责有害行为的"不安全票票",而修剪揭示了维持性能并实现对齐输出的"安全票票"。这为资源受限环境下的轻量级、事后对齐策略提供了可能。
引用
@article{arxiv.2604.15780,
title = {Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs},
author = {Wai Man Si and Mingjie Li and Michael Backes and Yang Zhang},
journal= {arXiv preprint arXiv:2604.15780},
year = {2026}
}