CLGRPO:面向小型视觉语言模型的推理能力提升
计算机视觉与模式识别
2025-08-12 v2
摘要
小型视觉语言模型 (SVLMs) 通常指参数规模不大于 20 亿的模型。其低成本和低功耗特性赋予了高度的商业价值。然而,其推理能力受参数数量的限制。为此,本文提出一种后训练优化范例,称为递增训练策略,以增强 SVLMs 的推理能力。首先,我们构建了自监督链式思维 (COT) 数据构造系统,利用参数为 7B 以上或更多的 LVLMs 以自监督方式将原始数据转换为 COT 数据。我们提出的递增训练策略包含四个阶段。阶段 1 通过在 COT 数据上对预训练模型进行监督微调 (SFT) 来注入领域知识。阶段 2 通过仅受格式奖励约束地在 COT 数据上进行少量的群体相对策略优化 (GRPO) 训练来对齐 COT 数据格式。阶段 3 通过在 COT 数据上施加格式和准确率奖励约束的 GRPO 训练来增强推理能力。得到的模型相较于基线模型表现显著提升。阶段 4 旨在解决 SVLMs 容量有限且捕捉复杂模式能力弱的问题,提出 ClipLow GRPO (CLGRPO) 以约束训练过程的捕获空间。我们在抽象语义识别数据集 EMOSet-118K 上进行了大量比较和消融实验。实验结果表明,我们的方法显著提升了 1B SVLM 的推理能力。相较于在原始数据上微调的基线模型,准确率提升 2.77,召回率提升 0.69,达到与 8B 模型相当的性能。
引用
@article{arxiv.2506.18048,
title = {CLGRPO: Reasoning Ability Enhancement for Small VLMs},
author = {Fanyi Wang and Binzhi Dong and Haotian Hu and Jinjin Xu and Zhiwang Zhang},
journal= {arXiv preprint arXiv:2506.18048},
year = {2025}
}
备注
11 pages, 5 figures