中文

APRICOT:基于大语言模型的主动偏好学习与约束感知任务规划

机器人学 2024-10-28 v1

摘要

执行个性化任务的家庭机器人必须巧妙地平衡用户偏好与环境可行性。在受限空间内完成组织任务(例如将物品排列到冰箱中)时,用户偏好可能会与物理限制发生冲突。机器人必须基于少量演示来推断用户偏好,而这对用户来说比定义所有要求更容易。虽然最近的工作使用大语言模型(LLM)从用户演示中学习偏好,但面临两个根本性挑战:首先,用户行为的解释存在内在歧义,因为单个观察行为可以有多种偏好解释;其次,并非所有用户偏好在实际中都是可行的,因为受环境几何限制。为此,我们提出APRICOT,将LLM基于贝叶斯的主动偏好学习与约束感知任务规划相结合。APRICOT通过主动查询用户来细化其生成的偏好,并动态地适应以尊重环境约束。我们在多样化的组织任务数据集上对APRICOT进行评估,并在实际场景中展示其有效性,在偏好满足度和计划可行性方面均取得显著改进。项目网站为https://portal-cornell.github.io/apricot/

关键词

引用

@article{arxiv.2410.19656,
  title  = {APRICOT: Active Preference Learning and Constraint-Aware Task Planning with LLMs},
  author = {Huaxiaoyue Wang and Nathaniel Chin and Gonzalo Gonzalez-Pumariega and Xiangwan Sun and Neha Sunkara and Maximus Adrian Pace and Jeannette Bohg and Sanjiban Choudhury},
  journal= {arXiv preprint arXiv:2410.19656},
  year   = {2024}
}

备注

Conference on Robot Learning (CoRL) 2024