中文

RPIQ:面向视障辅助的残差投影多协作闭环单实例量化

机器学习 2026-01-21 v2

摘要

视障用户面临着显著的日常信息获取和实时环境感知挑战,迫切需要具备准确识别能力的智能辅助系统。虽然大规模模型为感知和推理提供了有效解决方案,但其在辅助设备上的实际部署受到巨大的内存消耗和高推理成本的限制。此外,现有的量化策略常常忽视跨模块误差累积,导致模型稳定性下降。为此,本研究提出了一种新颖的量化框架——残差投影多协作闭环单实例量化(RPIQ),其量化过程采用基于单实例校准和高斯-赛德尔迭代量化的多协作闭环补偿方案。实验在各种类型的大规模模型上进行,包括语言模型如 OPT、Qwen 和 LLaMA,以及视觉语言模型如 CogVLM2,结果表明 RPIQ 可将模型压缩至 4 位表示,显著降低峰值内存消耗(相较于原始全精度模型约降低 60%-75%)。该方法在多个语言和视觉任务上保持性能高度接近全精度模型,展现出在关键应用如复杂场景下的文本理解和视觉问答等任务中,卓越的识别和推理能力。虽然验证了 RPIQ 在实际辅助系统部署中的有效性,但本研究也推进了大模型的计算效率和可靠性,使其能够为视障用户提供准确快速的信息。

关键词

引用

@article{arxiv.2601.02888,
  title  = {RPIQ: Residual-Projected Multi-Collaboration Closed-Loop and Single Instance Quantization for Visually Impaired Assistance},
  author = {Xuanyu Wang and Haisen Su and Jingtao Zhang and Xiangxiang Wang and Yongbin Yu and Manping Fan and Jialing Xiao and Bo Gong and Siqi Chen and Mingsheng Cao and Liyong Ren and Zhenglin Yang},
  journal= {arXiv preprint arXiv:2601.02888},
  year   = {2026}
}