中文

Triple-S:一种用于解决机器人长时域隐含任务的协作式多LLM框架

机器人学 2025-08-12 v1

摘要

利用大型语言模型(LLM)编写控制机器人的策略代码已获得广泛关注。然而,在长时域隐含任务中,这种方法常常导致API参数、注释和顺序错误,从而造成任务失败。为了解决这个问题,我们提出了一种协作式的Triple-S框架,该框架涉及多个LLM。通过上下文学习,不同的LLM在闭环的“简化-求解-总结”过程中扮演特定角色,有效提高了长时域隐含任务的成功率和鲁棒性。此外,一种从成功中学习的新型演示库更新机制使其能够泛化到先前失败的任务。我们在长时域桌面隐含放置(LDIP)数据集上,跨多种基线模型验证了该框架,其中Triple-S在可观测和部分可观测场景下均成功执行了89%的任务。在仿真和真实机器人环境中的实验进一步验证了Triple-S的有效性。我们的代码和数据集可在以下链接获取:https://github.com/Ghbbbbb/Triple-S。

关键词

引用

@article{arxiv.2508.07421,
  title  = {Triple-S: A Collaborative Multi-LLM Framework for Solving Long-Horizon Implicative Tasks in Robotics},
  author = {Zixi Jia and Hongbin Gao and Fashe Li and Jiqiang Liu and Hexiao Li and Qinghua Liu},
  journal= {arXiv preprint arXiv:2508.07421},
  year   = {2025}
}

备注

Accepted to IROS 2025