GROOT-2:弱监督多模态指令跟随智能体
人工智能
2024-12-17 v1 机器学习
机器人学
摘要
开发能够遵循多模态指令的智能体是机器人和AI领域的基本挑战。尽管大规模无标签数据集(无语言指令)的预训练已使智能体能够学习多样化行为,但这些智能体往往难以遵循指令。虽然通过 augment 数据集以指令标签可以缓解此问题,但以规模获取高质量注释在实际中不可行。为此,我们将问题建模为半监督学习任务,引入GROOT-2,这是一个结合弱监督与潜变量模型训练的多模态指令可跟随智能体。我们的方法包含两个关键组件:受限自我模仿(constrained self-imitating),利用大量无标签演示使策略学习多样化行为;人类意图对齐(human intention alignment),使用较小数量的标记演示确保潜在空间反映人类意图。GROOT-2的有效性在四个多样化环境中得到验证,涵盖从视频游戏到机器人操作操作等场景,展示了其强大的多模态指令跟随能力。
引用
@article{arxiv.2412.10410,
title = {GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents},
author = {Shaofei Cai and Bowei Zhang and Zihao Wang and Haowei Lin and Xiaojian Ma and Anji Liu and Yitao Liang},
journal= {arXiv preprint arXiv:2412.10410},
year = {2024}
}