中文

AnyBCQ:面向多精度大语言模型的硬件高效灵活二进制编码量化

机器学习 2026-02-03 v2 人工智能

摘要

大语言模型(LLMs)的部署日益受到内存与延迟瓶颈的制约,这促使人们需要能够灵活平衡精度与效率的量化技术。近期研究引入了多精度模型,使其能够在单一模型内根据运行时约束以多种精度进行推理。为支持这种灵活性,量化权重通常以位平面(bit-planes)形式存储,当计算直接在位平面层级进行,并仅激活各请求所需的精度时,硬件效率得以提升。本文提出 AnyBCQ,一种对硬件友好的二进制编码量化(BCQ)多精度扩展,支持直接的位平面运算。通过将权重表示为带有相应缩放因子的二进制位平面,AnyBCQ 实现了位平面级计算,并可自然映射到对加速器友好的位并行算术。我们提出的渐进式精度扩展机制在复用先前已分配的二进制编码的同时,逐步细化缩放因子,从而在启用更多比特时带来单调的精度提升。我们进一步协同设计了一个专用内核,利用 BCQ 结构以极低开销支持动态的逐请求精度选择。在近期 LLMs 上的实验表明,AnyBCQ 在低比特(如 2-bit)区间显著缩小了精度下降幅度,在更高精度下仍具竞争力,并相较半精度实现了最高 3.0 倍的吞吐提升,相较当前最优多精度方法实现了 1.2 倍的吞吐提升。通过将算法灵活性与硬件效率相统一,AnyBCQ 为跨多样化服务等级目标的多精度 LLM 部署提供了切实可行的基础。

关键词

引用

@article{arxiv.2510.10467,
  title  = {AnyBCQ: Hardware Efficient Flexible Binary-Coded Quantization for Multi-Precision LLMs},
  author = {Gunho Park and Jeongin Bae and Beomseok Kwon and Byeongwook Kim and Se Jung Kwon and Dongsoo Lee},
  journal= {arXiv preprint arXiv:2510.10467},
  year   = {2026}
}

备注

ICLR 2026