RQ-MoE:基于混合专家的残差量化用于高效输入相关向量压缩
机器学习
2026-05-15 v1 人工智能
摘要
向量量化是压缩高维嵌入的基础工具,但现有多码本方法依赖静态码本,限制了在异构数据几何下的表达能力。尽管 QINCo 等近期动态量化器能将码本适配于单个输入并提升表达能力,但其严格的序列依赖性造成了解码瓶颈。我们提出了基于混合专家的残差量化(RQ-MoE),这是一个结合双层 MoE 与双流量化的框架,以实现输入相关的码本适配,从而进行高效的向量量化。RQ-MoE 支持动态码本构建,并将指令与量化解耦,从而促进并行解码。在理论上,我们证明了标准残差量化和 QINCo 可作为 RQ-MoE 的受约束特例被恢复,并推导了 RQ-MoE 中专家维度设置的指导原则。大量实验表明,RQ-MoE 在重构和检索中达到了 SOTA 或持平的性能,同时解码速度比先前的向量量化方法快 6 倍至 14 倍。实现代码可在 https://github.com/KDEGroup/RQ-MoE 获取。
引用
@article{arxiv.2605.14359,
title = {RQ-MoE: Residual Quantization via Mixture of Experts for Efficient Input-Dependent Vector Compression},
author = {Zhengjia Zhong and Shuyan Ke and Zaizhou Lin and Jiaqi Song and Hongyi Lan and Hui Li},
journal= {arXiv preprint arXiv:2605.14359},
year = {2026}
}
备注
To appear at ICML 2026