Affordance-R1:多模态大语言模型中用于可泛化可供性推理的强化学习
机器人学
2026-05-21 v5 计算机视觉与模式识别
摘要
可供性定位侧重于预测与机器人要执行的动作相关联的物体特定区域。它在人机交互、人与物体交互、具身操作和具身感知等领域起着至关重要的作用。现有模型通常忽略了不同物体之间共享的可供性,因为它们缺乏思维链(CoT)推理能力,限制了它们的域外(OOD)泛化和显式推理能力。为了应对这些挑战,我们提出了 Affordance-R1,这是第一个在强化学习范式内集成认知 CoT 引导的组相对策略优化(GRPO)的统一可供性定位框架。具体来说,我们设计了一个复杂的可供性函数,其中包含格式、感知和认知奖励,以有效指导优化方向。此外,我们构建了一个高质量的可供性为中心的推理数据集 ReasonAff,以支持训练。仅通过 GRPO 的强化学习进行训练,无需显式推理数据,Affordance-R1 实现了鲁棒的零样本泛化,并展现出涌现的测试时推理能力。综合实验表明,我们的模型优于成熟的方法,并展现出开放世界泛化能力。据我们所知,Affordance-R1 是第一个将基于 GRPO 的 RL 与推理集成到可供性推理中的工作。我们的方法和数据集的代码发布在 https://github.com/hq-King/Affordance-R1。
引用
@article{arxiv.2508.06206,
title = {Affordance-R1: Reinforcement Learning for Generalizable Affordance Reasoning in Multimodal Large Language Model},
author = {Hanqing Wang and Shaoyang Wang and Yiming Zhong and Zemin Yang and Jiamin Wang and Zhiqing Cui and Jiahao Yuan and Yifan Han and Mingyu Liu and Yuexin Ma},
journal= {arXiv preprint arXiv:2508.06206},
year = {2026}
}