Learning to Build by Building Your Own Instructions
人工智能
2024-10-03 v1 机器人学
摘要
对复杂视觉对象的结构理解是人工智能中尚未解决的重要组成部分。为研究此问题,我们开发了一种新技术,用于LTRON中最近提出的Break-and-Make问题:智能体必须通过单一交互式会话来gather关于其组件及其结构的信息,以学习如何构建一个之前未见过的积木装配。我们通过构建一个称为\textbf{\ours}的智能体来攻击此问题,该智能体能够为自己创建视觉指令书。通过拆解未见的装配并定期保存其图像,智能体能够创建一组指令,以便在重建时具有必要的信息。这些指令形成一个显式记忆,允许模型逐步推理装配过程,避免对长期隐式记忆的需求。这进而允许我们在过去可能的积木装配规模上进行训练。为展示该模型的强大功能,我们发布了一个由程序化生成的积木车辆数据集,平均包含31个积木块,需要超过100步来拆解和重组。我们使用在线模仿学习训练这些模型,这允许模型从自身错误中学习。最后,我们还对LTRON和Break-and-Make问题提供一些小改进,以简化学习环境并提高可用性。
引用
@article{arxiv.2410.01111,
title = {Learning to Build by Building Your Own Instructions},
author = {Aaron Walsman and Muru Zhang and Adam Fishman and Ali Farhadi and Dieter Fox},
journal= {arXiv preprint arXiv:2410.01111},
year = {2024}
}