中文

从玩耍到策略:基于未筛选机器人数据的条件行为生成

机器人学 2022-12-19 v3 人工智能 计算机视觉与模式识别 机器学习

摘要

尽管基于离线数据的大规模序列建模在自然语言和图像生成中带来了令人印象深刻的性能提升,直接将此类思想迁移到机器人领域一直充满挑战。一个关键原因在于,由非专家人类演示者收集的未筛选机器人演示数据(即玩耍数据)往往含噪、多样且呈分布多模态。这使得从此类数据中提取有用的、以任务为中心的行为成为困难的生成建模问题。本工作中,我们提出条件行为 Transformer(C-BeT),一种将 Behavior Transformer 的多模态生成能力与未来条件目标设定相结合的方法。在一系列模拟基准任务上,我们发现 C-BeT 相较先前从玩耍数据学习的最优工作平均提升 45.7%。进一步,我们首次证明,无需任何任务标签或奖励信息,仅从玩耍数据即可在真实世界机器人上学习到有用的以任务为中心的行为。机器人视频请于我们的项目网站最佳观看:https://play-to-policy.github.io

关键词

引用

@article{arxiv.2210.10047,
  title  = {From Play to Policy: Conditional Behavior Generation from Uncurated Robot Data},
  author = {Zichen Jeff Cui and Yibin Wang and Nur Muhammad Mahi Shafiullah and Lerrel Pinto},
  journal= {arXiv preprint arXiv:2210.10047},
  year   = {2022}
}

备注

Code and data available at: https://play-to-policy.github.io; (fixed metadata author name format)