通过对比对齐损失实现安全保持的 PTQ
人工智能
2026-03-19 v5
摘要
后训练量化(PTQ)已成为高效 LLM 部署事实标准,其优化目标仍然不完整。标准 PTQ 方法最小化重构误差(如 MSE 或 KL 散度),而未考虑行为对齐——这是通过安全微调所赋予的关键属性。我们展示,这一目标不匹配引入了系统性漏洞:模型可保持低囊惑度,却在安全对齐方面出现显著退化,表明囊惑度本身是不充分且常常误导部署准备性的代理指标。为此,我们提出对比对齐量化(CAQ),它通过集成对比对齐损失(CAL)扩展了 PTQ 目标设计空间。CAL 引入一种原则性的推拉机制,联合优化分布保真度和行为对齐:它将量化模型引向其安全指令微调版本,同时与非对齐的预训练参考版本保持距离。CAQ 无需专门的安全数据集,仅依赖标准校准数据,并在现有基于转换的 PTQ 流水线上引入可忽略的计算开销。我们表明,CAQ 使 4 位(W4A4)量化在包括 LLaMA、Qwen 和 Mistral 在内的多样模型家族中实现了稳健量化,在这些情况下,最先进的 PTQ 方法在安全对齐方面会失败,而不会牺牲通用能力。其中提供的匿名代码已在补充材料中提供。
引用
@article{arxiv.2511.07842,
title = {Safety-Preserving PTQ via Contrastive Alignment Loss},
author = {Sunghyun Wee and Suyoung Kim and Hyeonjin Kim and Kyomin Hwang and Nojun Kwak},
journal= {arXiv preprint arXiv:2511.07842},
year = {2026}
}
备注
9 pages, 4 figures. Includes 8 pages of supplementary material