拿出银器——存储类家居物品的语义理解
摘要
“给我拿个盘子来。”对于家庭服务机器人而言,这个简单的指令揭示了一个复杂的挑战:推断日常物品存放于何处,而这些物品通常位于抽屉、橱柜或壁橱等视线之外的地方。尽管在视觉和操作方面取得了进展,机器人仍然缺乏完成此任务所需的常识推理能力。我们引入了存储类家居物品挑战,这是一个用于评估服务机器人认知能力的基准任务:给定一个家庭场景和一个被查询的物品,预测其最可能的存放位置。我们的基准包含两个数据集:(1)包含 100 个物品-图像对的真实世界评估集,其人工标注的真值来自参与者的厨房;(2)包含 6,500 个物品-图像对的开发集,在公开厨房图像上标注了存储多边形。这些数据集支持对家庭组织方式进行现实建模,并能够跨智能体架构进行对比评估。为了开始应对这一挑战,我们引入了 NOAM(Non-visible Object Allocation Model,非可见物体分配模型),这是一种将结构化场景理解与大型语言模型推理相结合的混合智能体管道。NOAM 将视觉输入转换为空间上下文和可见容器的自然语言描述,然后提示语言模型(如 GPT-4)推断最可能的隐藏存储位置。这种集成的视觉-语言智能体展现出涌现的常识推理能力,并专为在更广泛的机器人系统中进行模块化部署而设计。我们针对包括随机选择、视觉-语言管道(Grounding-DINO + SAM)、领先的多模态模型(如 Gemini、GPT-4o、Kosmos-2、LLaMA、Qwen)以及人类表现在内的基线对 NOAM 进行了评估。NOAM 显著提高了预测准确率并接近人类水平的结果,突出了在家庭环境中部署具备认知能力的智能体的最佳实践。
引用
@article{arxiv.2512.23739,
title = {Break Out the Silverware -- Semantic Understanding of Stored Household Items},
author = {Michaela Levi-Richter and Reuth Mirsky and Oren Glickman},
journal= {arXiv preprint arXiv:2512.23739},
year = {2026}
}
备注
Poster presented at the Israeli Seminar on Computational Linguistics 2025