为具身问答生成与评估情境查询:房子是否准备好睡觉?
机器人学
2025-03-12 v3 人工智能
摘要
我们提出并解决了具身问答(EQA)中的情境查询(S-EQA)问题,具体环境为住宅场景。不同于先前处理直接引用目标对象及其属性的简单查询(如"汽车的颜色是什么?"),情境查询(如"房子准备好睡觉了吗?")具有挑战性,因其要求智能体正确识别多个对象状态(如:门:关闭、灯:关闭等),并就其状态达成一致以作出回答。为此,我们首先引入一种新颖的 Prompt-Generate-Evaluate(PGE)方案,包裹在大语言模型(LLM)输出之上,用于生成唯一的情境查询及其对应的共识对象信息。PGE 用于在 VirtualHome 模拟器中生成 2000 条数据点,随后通过在 M-Turk 上进行的大规模用户研究标注其真实答案。本研究显示,在 97.26% 的可回答率下,证明大语言模型在生成情境数据方面表现良好。然而,在使用大语言模型评估数据时,我们发现其与人类真实标注之间的相关性仅为 46.2%;这表明尽管大语言模型擅长生成情境数据,但在达成共识方面仍难以按人类标准回答。当被问及推理时,我们发现大语言模型常常违背常识来为其答案辩护。最后,我们利用 PGE 在真实环境中生成情境数据,揭示在缺乏结构化场景图时,大语言模型在生成可靠对象状态方面会出现幻觉。到目前为止,本文是首个引入情境查询语境下的具身问答,也是首个提出用于查询生成的生成式方法。我们旨在通过本工作促进提升具身智能体在真实场景中可用性的研究。
关键词
引用
@article{arxiv.2405.04732,
title = {Is the House Ready For Sleeptime? Generating and Evaluating Situational Queries for Embodied Question Answering},
author = {Vishnu Sashank Dorbala and Prasoon Goyal and Robinson Piramuthu and Michael Johnston and Reza Ghanadhan and Dinesh Manocha},
journal= {arXiv preprint arXiv:2405.04732},
year = {2025}
}
备注
10 Pages