中文

预训练文本到图像模型能否为强化学习生成视觉目标?

机器人学 2023-07-18 v1

摘要

预训练的文本到图像生成模型能够根据自然语言描述生成多样、语义丰富且真实的图像。与语言相比,图像通常以更多细节和更少歧义传达信息。在本研究中,我们提出 Learning from the Void(LfVoid),一种利用预训练文本到图像模型和先进图像编辑技术来引导机器人学习的方法。给定自然语言指令,LfVoid 可以编辑原始观测以获得目标图像,例如将桌面上的“污渍”擦除。随后,LfVoid 在生成的图像上训练一个集成目标判别器,为强化学习智能体提供奖励信号,引导其达成目标。LfVoid 能够在无需专家演示或真实目标观测(即 void)的领域内训练的情况下学习,这归功于对来自网络规模生成模型知识的利用。我们在三项仿真任务上评估了 LfVoid,并验证了其在相应真实场景中的可行性。此外,我们提供了将视觉生成模型有效整合进机器人学习流程的关键考量。我们认为,我们的工作是将预训练视觉生成模型更广泛应用到机器人领域的初步一步。项目页面:https://lfvoid-rl.github.io/。

关键词

引用

@article{arxiv.2307.07837,
  title  = {Can Pre-Trained Text-to-Image Models Generate Visual Goals for Reinforcement Learning?},
  author = {Jialu Gao and Kaizhe Hu and Guowei Xu and Huazhe Xu},
  journal= {arXiv preprint arXiv:2307.07837},
  year   = {2023}
}