JARVIS:面向对话式具身智能体的神经符号常识推理框架
人工智能
2025-09-04 v4 计算与语言
计算机视觉与模式识别
机器人学
摘要
构建能够执行现实任务的对话式具身智能体一直是一个长期且极具挑战性的研究目标,因为它需要有效的人-智能体通信、多模态理解、长程序列决策等。传统的符号方法存在可扩展性和泛化问题,而端到端深度学习模型受限于数据稀缺和高任务复杂度,且往往难以解释。为了兼顾两者优势,我们提出 JARVIS,一种用于模块化、可泛化且可解释的对话式具身智能体的神经符号常识推理框架。首先,它通过提示大语言模型(LLM)进行语言理解和子目标规划,并从视觉观测构建语义地图来获取符号表示。然后符号模块基于任务和动作层面的常识进行子目标规划与动作生成推理。在 TEACh 数据集上的大量实验验证了我们 JARVIS 框架的有效性和高效性,其在所有三个基于对话的具身任务上均取得了最先进(SOTA)结果,包括基于对话历史执行(EDH)、基于对话的轨迹生成(TfD)和双智能体任务完成(TATC)(例如,我们的方法将 EDH 上未见过场景的成功率从 6.1% 提升到 15.8%)。此外,我们系统性地分析了影响任务性能的关键因素,并展示了我们的方法在少样本设置下的优越性。我们的 JARVIS 模型在 Alexa Prize SimBot 公开基准挑战赛中排名第一。
引用
@article{arxiv.2208.13266,
title = {JARVIS: A Neuro-Symbolic Commonsense Reasoning Framework for Conversational Embodied Agents},
author = {Kaizhi Zheng and Kaiwen Zhou and Jing Gu and Yue Fan and Jialu Wang and Zonglin Di and Xuehai He and Xin Eric Wang},
journal= {arXiv preprint arXiv:2208.13266},
year = {2025}
}
备注
19th International Conference on Neurosymbolic Learning and Reasoning