Mixture-of-Experts 2D 铺tile 低秩量化——TileQ
机器学习
2026-05-12 v1
摘要
Mixture-of-Experts (MoE) 模型通过稀疏激活专用专家实现了卓越的性能,但其专家中巨大的参数规模为部署带来了重大挑战。虽然低秩量化提供了可行的压缩 MoE 模型的途径,但现有方法仍产生显著的内存开销和推理延迟。为此,我们提出了 TileQ—a 一种无需微调的后训练量化 (PTQ) 方法,采用 2D 铺tile 结构化低秩量化在 MoE 专家的输入和输出维度之间共享低秩因子。此外,我们引入一种高效推理技术用于 TileQ,将多个低秩专家计算融合为单一操作,显著提高硬件利用率。实验表明,TileQ 可将额外内存使用降低最高 10 倍,推理延迟降至约 5%,同时保持最先进的准确率。
引用
@article{arxiv.2605.09281,
title = {TileQ: Efficient Low-Rank Quantization of Mixture-of-Experts with 2D Tiling},
author = {Hongyaoxing Gu and Xinzhe Chen and Lijuan Hu and Fangfang Liu},
journal= {arXiv preprint arXiv:2605.09281},
year = {2026}
}