中文

半自主智能体的快速语言-动作偏好学习

人工智能 2026-05-19 v4 机器人学

摘要

机器人必须从人们的行为和言语中学习,但单一模式往往不完整:物理纠正虽然具备 grounding 却在意图意义上模糊,而语言表达高层次目标却缺乏物理 grounding。我们提出 QuickLAP:Quick Language-Action Preference learning,这是一种贝叶斯框架,用于融合物理和语言反馈,实时推断奖励函数。我们的关键洞见是将语言视为用户潜在偏好上的概率观察,从而阐明哪些奖励特征重要以及如何解释物理纠正。QuickLAP 使用大型语言模型 (LLM) 从自由形式语料中提取奖励特征注意力掩码和偏好变化,并将其与物理反馈集成到闭式更新规则中。这使得快速、实时且鲁棒的奖励学习成为可能,能够处理模糊反馈。在半自主驾驶模拟器中,QuickLAP 将奖励学习误差降低了超过 70%,显著优于仅使用物理反馈或启发式多模态基线方法。15 名参与者的用户研究进一步验证了我们的方案:参与者认为 QuickLAP 在可理解性和协作性方面显著优于基线方法,更倾向于其学习到的行为。代码已公开于 https://github.com/MIT-CLEAR-Lab/QuickLAP。

关键词

引用

@article{arxiv.2511.17855,
  title  = {QuickLAP: Quick Language-Action Preference Learning for Semi-Autonomous Agents},
  author = {Jordan Abi Nader and David Lee and Nathaniel Dennler and Andreea Bobu},
  journal= {arXiv preprint arXiv:2511.17855},
  year   = {2026}
}