中文

你打盹,你就输:通过神经权重平移自动恢复安全对齐

密码学与安全 2026-05-07 v1

摘要

开源生态系统通过公开发布专用的低秩适应(Low-Rank Adaptation, LoRA)模块,加速了大语言模型(LLM)的普及。然而,集成这些第三方适配器通常会导致基础模型基础安全对齐的灾难性遗忘。通过在安全数据上微调来恢复这些防护机制会引入一种对立的失败模式:严重退化适配器最初旨在提供的专有领域知识。为了克服这一零资源挑战,我们提出了神经权重平移(Neural Weight Translation, NeWTral),这是一个直接将不安全的特定领域适配器映射到安全对齐流形上,同时严格保留其核心专业知识的框架。NeWTral 作为一个在多样化的不安全到安全的适配器对语料库上预训练的非线性平移模块运行。通过完全在参数空间内执行此映射,NeWTral 利用自适应混合专家路由策略,自主融合高保真的精细翻译器和激进的对齐专家。我们在八个不同的科学和专业领域,跨越四个架构家族(Llama、Mistral、Qwen 和 Gemma),对高达 72B 参数的规模评估了我们的框架。结果表明,MoE 变体实现了平均攻击成功率(Attack Success Rate, ASR)的大幅降低,从不安全专家的 70% 降至仅 13%,同时保持了出色的 90% 平均知识保真度。正如它所修复的众包适配器一样,NeWTral 模块被设计为一个独立的、可下载的资产,允许从业者立即恢复安全对齐,而无需访问原始训练数据或进行硬件密集型的重训练。

关键词

引用

@article{arxiv.2605.04992,
  title  = {You Snooze, You Lose: Automatic Safety Alignment Restoration through Neural Weight Translation},
  author = {Marco Arazzi and Vignesh Kumar Kembu and Antonino Nocera and Stjepan Picek and Saraga Sakthidharan},
  journal= {arXiv preprint arXiv:2605.04992},
  year   = {2026}
}