中文

Fake or Real, Can Robots Tell? 评估单视图机器人场景理解中视觉语言模型对域迁移的鲁棒性

机器人学 2026-04-24 v3 人工智能 计算与语言 计算机视觉与模式识别 机器学习

摘要

机器人场景理解日益依赖于视觉语言模型(VLM)来生成环境的自然语言描述。本文系统评估了针对机器人操作器捕获的桌面场景进行的单视图目标标注,我们引入了受控的物理域迁移,将真实世界工具与几何相似的3D打印制品进行对比,这些制品在纹理、颜色和材料方面存在差异。我们对一套最新的本地可部署VLMs进行基准测试,通过多个指标评估语义对齐和事实 grounding 能力。我们的结果表明,尽管VLMs能够有效描述常见的真实世界对象,但在结构形式熟悉的3D打印制品上性能显著下降。我们进一步暴露了标准评估指标的关键漏洞,部分指标甚至无法检测域迁移,或对流畅但事实错误的标注给予错误的奖励。这些发现凸显了为具身智能体部署基础模型的局限性,以及在物理机器人应用中需要更健壮的架构和评估协议。

关键词

引用

@article{arxiv.2506.19579,
  title  = {Fake or Real, Can Robots Tell? Evaluating VLM Robustness to Domain Shift in Single-View Robotic Scene Understanding},
  author = {Federico Tavella and Amber Drinkwater and Angelo Cangelosi},
  journal= {arXiv preprint arXiv:2506.19579},
  year   = {2026}
}