Praxis-VLM:基于文本驱动强化学习的视觉 grounding 决策
计算与语言
2025-10-07 v3 计算机视觉与模式识别
摘要
视觉语言模型在various任务中表现出惊人的性能,但往往缺乏处理复杂决策所需的深入情境推理能力。这篇论文表明,当视觉场景被替换为文本描述时,VLMs能够实现惊人的决策性能,这表明基础推理能力可以通过语言有效学习。基于这一洞察,我们提出了Praxis-VLM,这是一个用于视觉 grounding 决策的推理VL模型。Praxis-VLM在文本情境中采用GRPO算法,以在鲁棒的推理能力上不断训练,模型学习评估动作及其后果。这些从纯文本中获得的推理技能成功地迁移到多模态推理中,显著减少了对稀缺配对图像-文本训练数据的依赖。在多样化的决策基准测试中进行的实验表明,Praxis-VLM显著优于标准监督微调方法,展现出卓越的性能和广泛的适用性。进一步的分析确认,我们的模型进行的是明确且有效的推理,这为其增强的性能和适应性提供了支撑。
引用
@article{arxiv.2503.16965,
title = {Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning},
author = {Zhe Hu and Jing Li and Zhongzhu Pu and Hou Pong Chan and Yu Yin},
journal= {arXiv preprint arXiv:2503.16965},
year = {2025}
}
备注
Accepted at NeurIPS 2025