通过 rollout 增强学习视觉语言模型中的自我纠正
计算机视觉与模式识别
2026-02-10 v1 计算与语言
机器学习
摘要
自我纠正对于解决视觉语言模型(VLM)中的复杂推理问题至关重要。然而,现有强化学习(RL)方法难以学习这一行为,因为有效的自我纠正行为仅在稀有情况下出现,导致学习信号极度稀疏。为此,我们提出纠正特定的 rollout 增强框架(Octopus),通过重组现有 rollout 来合成稠密的自我纠正示例。该增强同时因 rollout 重用而提高样本效率,并通过平衡监督实现 RL 优化的稳定。进一步,我们引入一种响应遮蔽策略,将自我纠正与直接推理解耦,避免信号冲突,有效学习两种行为。基于此,我们构建了具备可控自我纠正能力的 Octopus-8B 推理 VLM。跨 7 个基准测试,本模型在开源 VLM 中实现最佳性能,相较于最佳 RLVR 基线提升 1.0 分数,仅需 的每步训练时间。
关键词
引用
@article{arxiv.2602.08503,
title = {Learning Self-Correction in Vision-Language Models via Rollout Augmentation},
author = {Yi Ding and Ziliang Qiu and Bolian Li and Ruqi Zhang},
journal= {arXiv preprint arXiv:2602.08503},
year = {2026}
}
备注
17 pages