STEVE-1:面向 Minecraft 中文本到行为的生成模型
人工智能
2024-02-06 v3 机器学习
摘要
构建能够响应文本指令的 AI 模型具有挑战性,尤其是对于序列决策任务。本文受 unCLIP 启发,提出了一种在不依赖大量指令标注轨迹数据集的情况下对行为生成模型进行指令微调的方法。利用该方法,我们创建了一个名为 STEVE-1 的指令微调视频预训练(VPT)模型,它可以在 Minecraft 中遵循短视野开放文本和视觉指令。STEVE-1 分两步训练:首先将预训练的 VPT 模型适配以遵循 MineCLIP 潜空间中的指令,然后训练一个先验从文本预测潜码。这使我们能够通过自监督行为克隆和事后重标注对 VPT 进行微调,减少了对昂贵人工文本标注的需求,且全部计算成本仅为 $60。通过利用 VPT 和 MineCLIP 等预训练模型并采用文本条件图像生成的最佳实践,STEVE-1 在以低级控制(鼠标和键盘)和原始像素输入在 Minecraft 中进行开放指令遵循方面树立了新的标杆,远超以往基线,并在我们早期游戏评估套件中稳健完成 13 项任务中的 12 项。我们提供了实验证据,突出了下游性能的关键因素,包括预训练、无分类器引导和数据扩展。所有资源,包括我们的模型权重、训练脚本和评估工具均已公开以供进一步研究。
引用
@article{arxiv.2306.00937,
title = {STEVE-1: A Generative Model for Text-to-Behavior in Minecraft},
author = {Shalev Lifshitz and Keiran Paster and Harris Chan and Jimmy Ba and Sheila McIlraith},
journal= {arXiv preprint arXiv:2306.00937},
year = {2024}
}