中文

PLAICraft:大规模时间对齐的视觉-语音-动作数据集用于具身 AI

机器学习 2026-02-19 v2 人工智能 多智能体系统

摘要

深度生成模型的进步使得训练人类级具身智能体越来越可行。然而,由于缺乏反映自然环境感觉-运动复杂性的大规模、实时、多模态和社交互动数据集,进展受限。为此,我们提出 PLAICraft,一套新型数据收集平台和数据集,捕获跨五个时间对齐模态的 Minecraft 多人游戏互动:视频、游戏输出音频、麦克风输入音频、鼠标和键盘动作。每个模态以毫秒级时间精度记录,使我们能够在富有开放性的世界中研究同步的具身行为。该数据集包含来自 10,000 多名全球参与者的 10,000 小时的游戏时长。我们提供的评估套件用于基准测试模型在对象识别、空间感知、语言 grounding 和长期记忆方面的能力。PLAICraft 为训练和评估能够在真实时间内流畅且有目的地行动的智能体铺路,为 truly具身人工智能 之路。

关键词

引用

@article{arxiv.2505.12707,
  title  = {PLAICraft: Large-Scale Time-Aligned Vision-Speech-Action Dataset for Embodied AI},
  author = {Yingchen He and Christian D. Weilbach and Martyna E. Wojciechowska and Yuxuan Zhang and Frank Wood},
  journal= {arXiv preprint arXiv:2505.12707},
  year   = {2026}
}

备注

9 pages, 8 figures