中文

面向多模态大语言模型的云-设备协同学习

计算机视觉与模式识别 2023-12-29 v1

摘要

多模态大语言模型(MLLM)这一新兴领域在字幕生成、常识推理和视觉场景理解等多样化任务中展现出卓越性能。然而,这些大规模 MLLM 在客户端设备上的部署受到其庞大模型参数的阻碍,导致这些模型为设备部署而压缩时泛化能力显著下降。针对这一挑战,我们引入了一种云-设备协同持续适应框架,旨在通过利用云端更大规模 MLLM 的强大能力来提升压缩后的设备端 MLLM 的性能。我们的框架由三个关键组件构成:用于高效数据传输的设备到云上行链路、基于云的知识适应以及用于模型部署的优化云到设备下行链路。在上行链路阶段,我们采用不确定性引导的令牌采样(UTS)策略来有效过滤分布外令牌,从而降低传输成本并提高训练效率。在云端,我们提出基于适配器的知识蒸馏(AKD)方法,将精炼知识从大规模 MLLM 迁移到压缩的袖珍型 MLLM。此外,我们为下行链路提出了一种动态权重更新压缩(DWC)策略,该策略自适应地选择和量化更新的权重参数,提高传输效率并缩小云模型与设备模型之间的表示差异。在多个多模态基准上的大量实验表明,我们提出的框架优于先前的知识蒸馏和云-设备协作方法。值得注意的是,我们还验证了我们的方法在实际实验中的可行性。

关键词

引用

@article{arxiv.2312.16279,
  title  = {Cloud-Device Collaborative Learning for Multimodal Large Language Models},
  author = {Guanqun Wang and Jiaming Liu and Chenxuan Li and Junpeng Ma and Yuan Zhang and Xinyu Wei and Kevin Zhang and Maurice Chong and Ray Zhang and Yijiang Liu and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2312.16279},
  year   = {2023}
}