中文

当参数高效微调遇见通用视觉-语言模型

计算与语言 2023-12-21 v1 人工智能

摘要

指令微调通过使用大规模预训练模型,展现了开发通用 AI 能力的广阔前景,并推动了整合多模态信息以用于创意应用的研究热潮。然而,现有的工作仍面临两个主要局限:全模型微调的高训练成本和对重度计算资源的依赖,以及指令中语义信息的缺乏,这阻碍了多模态对齐。针对这些挑战,本文提出了一种利用参数高效微调构建通用视觉-语言模型的新方法,即 PETAL。PETAL 通过一种独特的模态近似技术,仅需 0.5% 的总参数即可,这彻底改变了训练过程,显著降低了训练成本和对重度计算资源的依赖。此外,PETAL 以两种创新方式增强了指令的语义深度:1) 引入自适应指令混合专家,2) 强化参数高效微调与互信息之间基于分数的关联。我们在五个多模态下游基准上的广泛实验表明,PETAL 不仅在大多数场景中优于当前最先进的方法,而且在有效性上超越了全微调模型。此外,通过全面的可视化分析支持,我们的方法在少样本设置中展现出显著优势。我们的源代码可在:https://github.com/melonking32/PETAL 获取。

关键词

引用

@article{arxiv.2312.12458,
  title  = {When Parameter-efficient Tuning Meets General-purpose Vision-language Models},
  author = {Yihang Zhai and Haixin Wang and Jianlong Chang and Xinlong Yang and Jinan Sun and Shikun Zhang and Qi Tian},
  journal= {arXiv preprint arXiv:2312.12458},
  year   = {2023}
}