BAP v2:Minecraft对话中指令遵循的增强任务框架
摘要
开发能够理解语言、感知自身周围环境并在物理世界中行动的交互式智能体是人工智能研究的长期目标。Minecraft协同建造任务(MCBT)(Narayan-Chen、Jayannavar和Hockenmaier 2019)——即一位建筑师(A)指挥一位建造者(B)在模拟的3D砖块世界环境中构建目标结构的两人游戏——为实现这一目标提供了丰富的平台。在本工作中,我们聚焦于建造者动作预测(BAP)子任务:在多模态游戏情境中预测B的动作——这是一项具有挑战性的 grounding instruction following 测试平台,数据有限。我们全面地重新审视了该任务,提出BAP v2以解决评估、训练数据和建模方面的关键挑战。具体而言,我们定义了一个增强的评估基准,包括更干净的测试集和更公平、更具洞察力的指标,这些指标还揭示了空间推理是主要的性能瓶颈。为了解决数据稀缺问题以及教导模型基本的空间技能,我们生成了不同类型的合成MCBT数据。我们观察到,当前在人类BAP对话上训练的 LLM-based SOTA模型在这些更简单的合成BAP数据上会失败,但通过在合成数据上训练模型可以显著提升整体性能。我们还引入了新的SOTA模型Llama-CRAFTS,该模型利用更丰富的输入表示,实现了BAP v2任务上53.0的 F1分数以及在合成数据上的强大性能。虽然该结果标志着与前一工作相比的显著6分的改进,但也凸显了该任务的剩余难度,确立了BAP v2作为未来研究的肥沃土壤,并提供了衡量当前 text-only LLM在此类具身任务中空间能力的有用方法。
引用
@article{arxiv.2501.10836,
title = {BAP v2: An Enhanced Task Framework for Instruction Following in Minecraft Dialogues},
author = {Prashant Jayannavar and Liliang Ren and Marisa Hudspeth and Risham Sidhu and Charlotte Lambert and Ariel Cordes and Elizabeth Kaplan and Anjali Narayan-Chen and Julia Hockenmaier},
journal= {arXiv preprint arXiv:2501.10836},
year = {2025}
}
备注
major revision; few examples of changes: added contemporary LLMs and new SOTA model, improved readability, expanded related work, etc