中文

StateVLM:用于机器人可供性推理的状态感知视觉-语言模型

计算机视觉与模式识别 2026-05-06 v1

摘要

视觉-语言模型 (VLMs) 在各种机器人任务中展现出了卓越的性能,因为它们能够感知视觉信息并理解自然语言指令。然而,当应用于机器人技术时,VLMs 仍然受到大语言模型 (LLMs) 固有的基本限制:它们在数值推理方面存在困难,特别是在目标检测和目标状态定位中。为了探索将数值推理作为 VLMs 中的回归任务,我们提出了一种新颖的训练策略,以使 VLMs 适应目标检测和目标状态定位。该方法利用边界框解码器输出在微调期间计算辅助回归损失 (ARL),同时在推理时保持标准序列预测。我们利用这一训练策略开发了 StateVLM (State-aware Vision-Language Model),这是一种新颖的模型,旨在感知和学习细粒度的目标表征,包括目标及其状态的精确定位,以及可抓取区域。由于缺乏用于目标状态可供性推理的基准,我们引入了一个开源基准 Object State Affordance Reasoning (OSAR),其中包含 1,172 个场景、7,746 个独立目标及对应的边界框。在适配的基准 (RefCOCO、RefCOCO+ 和 \mbox{RefCOCOg}) 上的对比实验表明,与没有 ARL 的模型相比,ARL 将模型性能平均提高了 1.6%。在 OSAR 基准上的实验进一步支持了这一发现,表明带有 ARL 的 StateVLM 比没有 ARL 的模型平均性能高出 5.2%。特别是,ARL 对于 OSAR 中可供性推理的复杂任务也很重要,它增强了模型输出的一致性。

关键词

引用

@article{arxiv.2605.03927,
  title  = {StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning},
  author = {Xiaowen Sun and Matthias Kerzel and Mengdi Li and Xufeng Zhao and Paul Striker and Stefan Wermter},
  journal= {arXiv preprint arXiv:2605.03927},
  year   = {2026}
}