记住你所做的,方能知晓下一步该做什么
计算与语言
2026-05-25 v1 机器学习
摘要
我们探索使用一个中等规模的大语言模型(GPT-J,60 亿参数)为模拟机器人创建计划,以在 ScienceWorld(一个面向基础科学实验的文本游戏模拟器)中实现 30 类目标。此前发表的实证工作声称,与强化学习相比,大语言模型(LLMs)表现不佳(Wang 等,2022)。利用马尔可夫假设(仅前一步),该 LLM 的性能优于基于强化学习的方法,提升倍数为 1.4。当我们用尽可能多的先前步骤填充 LLM 的输入缓冲区时,提升提高到 3.5 倍。即使在仅使用 6.5% 训练数据的情况下,我们仍观察到相较基于强化学习的方法有 2.2 倍的提升。我们的实验表明,性能在 30 类动作间差异显著,说明对任务取平均会掩盖重要的性能问题。在与我们同期的工作中,Lin 等(2023)展示了一种两部分方法(SwiftSage),其使用小型 LLM(T5-large)并辅以 OpenAI 的超大 LLM,在 ScienceWorld 中取得了出色结果。我们这一定参数量为 60 亿、单阶段的 GPT-J,在 SwiftSage 集成比 GPT-J 参数量多 29 倍的 GPT-3.5 turbo 时,与其两阶段架构性能相当。
引用
@article{arxiv.2311.01468,
title = {Remember what you did so you know what to do next},
author = {Manuel R. Ciosici and Alex Hedges and Yash Kankanampati and Justin Martin and Marjorie Freedman and Ralph Weischedel},
journal= {arXiv preprint arXiv:2311.01468},
year = {2026}
}
备注
Identical to EMNLP 2023 Findings