PT$^2$-LLM:面向大语言模型的后训练三值化
机器学习
2026-02-02 v2 人工智能
摘要
大语言模型(LLM)在 diverse 任务中展现出惊人的能力,但其巨大的内存和计算需求阻碍了部署。三值化因其显著的尺寸压缩和高计算效率而受到广泛关注,但在后训练量化(PTQ)setting 中的潜力仍未得到充分探索,这源于训练无参数优化和异常值及离散权重带来的量化难题。为此,我们提出 PT-LLM,一个专为大语言模型设计的后训练三值化框架。其核心是一种不对称三值量化器,配合两阶段细化管线:(1)迭代三值拟合(ITF),在最优三值网格构建与灵活取整之间交替,以最小化量化误差;(2)激活感知网格对齐(AGA),进一步细化三值网格以更好匹配全精度输出。此外,我们提出一种即插即用的结构相似性重排(SSR)策略,利用列间结构相似性来缓解量化难题并减轻异常值效应,从而提升整体性能。大量实验表明,PT-LLM 在较低内存消耗下,能够与最先进(SOTA)2 位 PTQ 方法保持竞争性能,同时加速 prefill 和 decoding 以实现端到端加速。代码和模型将发布于 https://github.com/XIANGLONGYAN/PT2-LLM。
引用
@article{arxiv.2510.03267,
title = {PT$^2$-LLM: Post-Training Ternarization for Large Language Models},
author = {Xianglong Yan and Chengzhu Bao and Zhiteng Li and Tianao Zhang and Kaicheng Yang and Haotong Qin and Ruobing Xie and Xingwu Sun and Yulun Zhang},
journal= {arXiv preprint arXiv:2510.03267},
year = {2026}
}
备注
Accepted at ICLR 2026