中文

POINTS:通过实用策略提升视觉语言模型性能

计算机视觉与模式识别 2024-11-06 v3 人工智能 多媒体

摘要

近年来,视觉语言模型取得了显著进展,在光学字符识别和几何问题解决等任务中表现出色。然而仍存在若干关键问题:1)专有模型往往缺乏对其架构的透明度说明,而开源模型需要更详尽的训练策略剖析。2)开源作品中的预训练数据探索不足,数据集往往是经验性添加的,使过程繁琐。3)微调往往侧重于添加数据集,导致效益递减。为此,我们提出了以下贡献:1)我们训练了一个稳健的基线模型,融合最新视觉语言模型的先进技术,引入有效改进,并对每项技术进行全面消化和验证。2)灵感来自大语言模型的最新研究,我们利用困惑度对预训练数据进行筛选,选取最低困惑度的数据进行训练。该方法使我们能够在精选的 100 万数据集上训练,实现与 SOTA 模型的竞争性能。3)在视觉指令调优期间,我们在添加数据集 yielded 边际改善时使用模型汤 (model soup) 处理不同数据集。这些创新导致我们训练了一个拥有 90 亿参数的模型,性能与最先进模型相竞争。我们的策略高效轻量,易于社区采纳。

关键词

引用

@article{arxiv.2409.04828,
  title  = {POINTS: Improving Your Vision-language Model with Affordable Strategies},
  author = {Yuan Liu and Zhongyin Zhao and Ziyuan Zhuang and Le Tian and Xiao Zhou and Jie Zhou},
  journal= {arXiv preprint arXiv:2409.04828},
  year   = {2024}
}

备注

v2