从大语言模型到现成智能体的具身思维链蒸馏
人工智能
2024-12-17 v1 机器人学
摘要
我们解决了在决策系统需在容量受限的现成设备上及时运行的环境中,利用大型语言模型(LLM)处理复杂具身任务的挑战。我们提出了DeDer,一个将具身推理能力从LLM分解并蒸馏到高效的小语言模型(sLM)策略的框架。在DeDer中,基于LLM的策略的决策过程被重构为推理策略和规划策略的层次结构。推理策略通过LLM的具身上下文学习和自我验证生成的数据进行蒸馏,从而能够产生有效的理由。规划策略在理由的指导下,能够高效地生成优化计划。反过来,DeDer允许采用sLM作为两种策略,部署在现成设备上。此外,为了提升具身任务中中间理由的质量,我们设计了具身知识图谱,并通过单次推理及时生成多个理由,我们还使用了对比提示注意力模型。我们在ALFRED基准上的实验表明,DeDer超越了领先的语言规划和蒸馏方法,展示了通过DeDer获得的基于sLM的具身策略的适用性和效率。
引用
@article{arxiv.2412.11499,
title = {Embodied CoT Distillation From LLM To Off-the-shelf Agents},
author = {Wonje Choi and Woo Kyung Kim and Minjong Yoo and Honguk Woo},
journal= {arXiv preprint arXiv:2412.11499},
year = {2024}
}
备注
Accepted at ICML 2024