中文

重新思考 LVLM 中的强化微调:收敛性、奖励分解与泛化

机器学习 2026-04-23 v1 计算与语言

摘要

使用可验证奖励的强化微调 (RLVR) 已成为赋予大型视觉语言模型 (LVLM) 诸如工具使用和多步推理等智能体能力的强大范式。尽管取得了显著的实证成功,尤其是视觉智能体强化微调 (Visual-ARFT),但对该范式理论基础的理解仍然不足。特别是,两个关键问题缺乏严格的答案: 可验证奖励的复合结构(格式合规性、答案准确性、工具可执行性)如何影响群组相对策略优化 (GRPO) 的收敛性,以及 为什么在一小部分工具增强任务上的训练能迁移到分布外领域?我们通过引入工具增强马尔可夫决策过程 (TA-MDP) 来填补这些空白,这是一个对具有有限深度工具调用的多模态智能体决策进行建模的形式化框架。在此框架内,我们建立了三个主要结果。首先,我们证明了在复合可验证奖励下的 GRPO 以 O(1/T)O(1/\sqrt{T}) 的速率收敛到一阶驻点,并明确依赖于奖励组件数量和群组大小(定理 1)。其次,我们推导出奖励分解定理,该定理界定了分解的逐组件优化与联合优化之间的次优性差距,精确刻画了奖励分解何时有益(定理 2)。第三,我们为工具增强策略建立了 PAC-Bayes 泛化界,解释了在 Visual-ARFT 中观察到的强分布外迁移(定理 3)。

关键词

引用

@article{arxiv.2604.19857,
  title  = {Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization},
  author = {Carter Adams and Rafael Oliveira and Gabriel Almeida and Sofia Torres},
  journal= {arXiv preprint arXiv:2604.19857},
  year   = {2026}
}