中文

结合量化感知尺度学习推进多模态大语言模型的高效适配

计算机视觉与模式识别 2024-08-08 v1 人工智能 机器学习

摘要

本文首次探索了利用参数量化来缓解多模态大语言模型在视觉-语言指令微调过程中遇到的显著资源约束。我们提出了一种基于多模态预热的量化感知尺度学习方法(QSLAW)。该方法基于两项关键创新:(1) 学习量化 LLM 权重的组尺度因子,以缓解由激活异常值引起的量化误差,从而实现更有效的视觉-语言指令微调;(2) 实施多模态预热,逐步整合语言和多模态训练样本,从而防止量化模型对多模态数据的过拟合,同时确保多模态大语言模型在下游视觉-语言任务上的稳定适配。大量实验表明,经 QSLAW 量化的模型性能与全精度模型相当,甚至更优,同时可将视觉-语言微调时间和 GPU 消耗降低高达 1.4 倍。代码已发布于 https://github.com/xjjxmu/QSLAW。

关键词

引用

@article{arxiv.2408.03735,
  title  = {Advancing Multimodal Large Language Models with Quantization-Aware Scale Learning for Efficient Adaptation},
  author = {Jingjing Xie and Yuxin Zhang and Mingbao Lin and Liujuan Cao and Rongrong Ji},
  journal= {arXiv preprint arXiv:2408.03735},
  year   = {2024}
}

备注

Accepted by ACMMM2024