Q-realign:基于量化的 Piggybacking Realignment 用于安全高效的 LLM 部署
机器学习
2026-01-14 v1 人工智能
摘要
公共大型语言模型 (LLM) 在预训练期间通常进行 safety 对齐,但针对部署的任务特定微调往往会削弱这种对齐并引入安全风险。现有防御要么将 safety 恢复嵌入微调,要么依赖微调派生的先验进行事后纠正,导致 safety 恢复严重依赖于训练并产生高计算开销和复杂的工作流程。为解决这些挑战,我们提出了 \texttt{Q-realign},一种基于事后量化的事后防御方法,由 representational structure 的分析指导。通过将量化重新框定为压缩和 safety 的双目标程序,\texttt{Q-realign} 将 safety 对齐从微调中解耦,并自然地 piggyback 到现代部署管道中。跨多个模型和数据集的实验表明,我们的方法在显著降低内存使用和 GPU 小时数的同时,大幅减少不安全行为并保持任务性能。值得注意的是,我们的 approach 能够在单块 RTX 4090 上在 40 分钟内恢复已微调 7B LLM 的 safety 对齐。总体而言,我们的工作提供了一个实用的、即插即用的数据安全-aware 部署解决方案。
引用
@article{arxiv.2601.08089,
title = {Q-realign: Piggybacking Realignment on Quantization for Safe and Efficient LLM Deployment},
author = {Qitao Tan and Xiaoying Song and Ningxi Cheng and Ninghao Liu and Xiaoming Zhai and Lingzi Hong and Yanzhi Wang and Zhen Xiang and Geng Yuan},
journal= {arXiv preprint arXiv:2601.08089},
year = {2026}
}