中文

通过反事实软强化学习实现 VLM 智能体的高效在线微调

机器学习 2025-06-04 v2 人工智能

摘要

使用强化学习(RL)在线微调视觉语言模型(VLM)智能体已显示出为智能体在动态环境中配备多步骤、目标导向能力的潜力。然而,其开放的文本动作空间和动作生成的非端到端特性给 RL 中的有效在线探索带来了重大挑战,例如探索空间的爆炸。我们提出了一种新颖的在线微调方法,即反事实软强化学习(CoSo),它更适合 VLM 智能体的文本输出空间。与先前对所有词元分配统一不确定性的方法相比,CoSo 利用反事实推理动态评估单个词元对后处理动作的因果影响。通过优先探索动作关键型词元,同时降低语义冗余或低影响词元的影响,CoSo 实现了更有针对性、更高效的在线 rollout 过程。我们提供了理论分析,证明了 CoSo 的收敛性和策略改进保证,并提供了广泛的实证评估支持 CoSo 的有效性。我们在包括 Android 设备控制、纸牌游戏和具身智能在内的多种智能体任务上的结果,突显了其提升探索效率和提供持续性能增益的卓越能力。代码可在 https://github.com/langfengQ/CoSo 获取。

关键词

引用

@article{arxiv.2505.03792,
  title  = {Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement Learning},
  author = {Lang Feng and Weihao Tan and Zhiyi Lyu and Longtao Zheng and Haiyang Xu and Ming Yan and Fei Huang and Bo An},
  journal= {arXiv preprint arXiv:2505.03792},
  year   = {2025}
}

备注

ICML 2025