POINTS:通过实用策略提升视觉语言模型性能
计算机视觉与模式识别
2024-11-06 v3 人工智能
多媒体
摘要
近年来,视觉语言模型取得了显著进展,在光学字符识别和几何问题解决等任务中表现出色。然而仍存在若干关键问题:1)专有模型往往缺乏对其架构的透明度说明,而开源模型需要更详尽的训练策略剖析。2)开源作品中的预训练数据探索不足,数据集往往是经验性添加的,使过程繁琐。3)微调往往侧重于添加数据集,导致效益递减。为此,我们提出了以下贡献:1)我们训练了一个稳健的基线模型,融合最新视觉语言模型的先进技术,引入有效改进,并对每项技术进行全面消化和验证。2)灵感来自大语言模型的最新研究,我们利用困惑度对预训练数据进行筛选,选取最低困惑度的数据进行训练。该方法使我们能够在精选的 100 万数据集上训练,实现与 SOTA 模型的竞争性能。3)在视觉指令调优期间,我们在添加数据集 yielded 边际改善时使用模型汤 (model soup) 处理不同数据集。这些创新导致我们训练了一个拥有 90 亿参数的模型,性能与最先进模型相竞争。我们的策略高效轻量,易于社区采纳。
引用
@article{arxiv.2409.04828,
title = {POINTS: Improving Your Vision-language Model with Affordable Strategies},
author = {Yuan Liu and Zhongyin Zhao and Ziyuan Zhuang and Le Tian and Xiao Zhou and Jie Zhou},
journal= {arXiv preprint arXiv:2409.04828},
year = {2024}
}
备注
v2