中文

Q-realign:基于量化的 Piggybacking Realignment 用于安全高效的 LLM 部署

机器学习 2026-01-14 v1 人工智能

摘要

公共大型语言模型 (LLM) 在预训练期间通常进行 safety 对齐,但针对部署的任务特定微调往往会削弱这种对齐并引入安全风险。现有防御要么将 safety 恢复嵌入微调,要么依赖微调派生的先验进行事后纠正,导致 safety 恢复严重依赖于训练并产生高计算开销和复杂的工作流程。为解决这些挑战,我们提出了 \texttt{Q-realign},一种基于事后量化的事后防御方法,由 representational structure 的分析指导。通过将量化重新框定为压缩和 safety 的双目标程序,\texttt{Q-realign} 将 safety 对齐从微调中解耦,并自然地 piggyback 到现代部署管道中。跨多个模型和数据集的实验表明,我们的方法在显著降低内存使用和 GPU 小时数的同时,大幅减少不安全行为并保持任务性能。值得注意的是,我们的 approach 能够在单块 RTX 4090 上在 40 分钟内恢复已微调 7B LLM 的 safety 对齐。总体而言,我们的工作提供了一个实用的、即插即用的数据安全-aware 部署解决方案。

关键词

引用

@article{arxiv.2601.08089,
  title  = {Q-realign: Piggybacking Realignment on Quantization for Safe and Efficient LLM Deployment},
  author = {Qitao Tan and Xiaoying Song and Ningxi Cheng and Ninghao Liu and Xiaoming Zhai and Lingzi Hong and Yanzhi Wang and Zhen Xiang and Geng Yuan},
  journal= {arXiv preprint arXiv:2601.08089},
  year   = {2026}
}