基于不完美世界模型的大型语言模型在具身环境中的 grounding
计算与语言
2024-11-13 v2 机器学习
机器人学
摘要
尽管在各种应用中取得了广泛成功,大型语言模型(LLM)在处理基本的物理推理或执行机器人任务时常常会遇到困难,由于缺乏与物理世界细微差别的直接经验。为此,我们提出了一种名为“基于不完美世界模型的大型语言模型 grounding”(GLIMO)的方法,该方法利用代理世界模型(如模拟器)收集和合成训练数据。GLIMO集成了一个基于LLM代理的数据生成器,用于自动创建高质量且多样化的指令数据集。生成器包括用于时序一致经验采样的迭代自我完善模块、多样化的问答指令种子,以及用于反思先前经验的检索增强生成模块。进行全面实验后,我们的方法在三个不同的基准测试中分别为LLaMA-3等强大的开源LLM带来了2.04倍、1.54倍和1.82倍的性能提升。该性能能够与或超过如GPT-4等更大规模的模型相抗衡。
引用
@article{arxiv.2410.02742,
title = {Grounding Large Language Models In Embodied Environment With Imperfect World Models},
author = {Haolan Liu and Jishen Zhao},
journal= {arXiv preprint arXiv:2410.02742},
year = {2024}
}