中文

LLM-Personalize: 通过强化自训练使LLM规划器与人类偏好对齐的家务机器人

机器人学 2024-12-31 v3 人工智能

摘要

大型语言模型(LLMs)通过利用其语言理解和文本生成能力,在机器人应用(特别是任务规划)中展现出巨大潜力。然而,在家庭机器人等应用中,这些模型在个性化适应个体用户偏好方面仍存在关键差距。我们提出LLM-Personalize,一个新颖的框架,包含一个优化流水线,旨在为家庭机器人个性化LLM规划器。我们的LLM-Personalize框架包含一个LLM规划器,它在多房间、部分可观察的家庭场景中执行迭代规划,利用局部观测构建的场景图。生成的计划由一系列高层动作组成,随后由控制器执行。我们方法的核心是优化流水线,它结合了模仿学习和迭代自训练来个性化LLM规划器。特别地,模仿学习阶段从示范中进行初始LLM对齐,并引导模型以促进有效的迭代自训练,进一步探索并使模型与用户偏好对齐。我们在Housekeep(一个具有挑战性的模拟真实世界3D家庭整理基准)上评估LLM-Personalize,结果表明,与现有LLM规划器相比,LLM-Personalize的成功率提高了30%以上,展示了与人类偏好的显著改善的对齐。项目页面:https://gdg94.github.io/projectllmpersonalize/。

关键词

引用

@article{arxiv.2404.14285,
  title  = {LLM-Personalize: Aligning LLM Planners with Human Preferences via Reinforced Self-Training for Housekeeping Robots},
  author = {Dongge Han and Trevor McInroe and Adam Jelley and Stefano V. Albrecht and Peter Bell and Amos Storkey},
  journal= {arXiv preprint arXiv:2404.14285},
  year   = {2024}
}

备注

COLING 2025