RT-Affordance: 能力作为机器人操作的通用中间表示
机器人学
2024-11-06 v1 人工智能
计算与语言
计算机视觉与模式识别
机器学习
摘要
我们探索了中间策略表示如何通过提供如何执行操作任务的指导来促进泛化。已有的表示如语言、目标图像和轨迹草图已被证明是有帮助的,但这些表示要么提供的上下文不足,要么提供的上下文过度指定从而导致鲁棒性较差的策略。我们提出以能力(affordances)作为策略的条件,它捕获任务关键阶段中机器人的姿态。能力提供了表达力强且轻量的抽象,易于用户指定,并通过从大型互联网数据集迁移知识来促进高效学习。我们的方法 RT-Affordance 是一个层次化模型,它首先根据任务语言提出能力计划,然后以该能力计划为条件来执行操作。我们的模型可以灵活地桥接异质的监督来源,包括大型网络数据集和机器人轨迹。我们还使用低成本采集的领域内能力图像训练模型,使我们能够在不收集任何额外昂贵的机器人轨迹的情况下学习新任务。我们在一组多样化的新任务上展示了 RT-Affordance 如何以超过 的性能超越现有方法,并经验性地证明了能力对新环境的鲁棒性。
引用
@article{arxiv.2411.02704,
title = {RT-Affordance: Affordances are Versatile Intermediate Representations for Robot Manipulation},
author = {Soroush Nasiriany and Sean Kirmani and Tianli Ding and Laura Smith and Yuke Zhu and Danny Driess and Dorsa Sadigh and Ted Xiao},
journal= {arXiv preprint arXiv:2411.02704},
year = {2024}
}