中文

通过世界模型发现并实现目标

机器学习 2021-10-19 v1 人工智能 计算机视觉与模式识别 机器人学 机器学习

摘要

在没有任何监督的情况下,人工智能体如何学会在复杂的视觉环境中解决许多不同的任务?我们将这个问题分解为两个问题:发现新目标和学习可靠地实现它们。我们引入了Latent Explorer Achiever (LEXA),作为这两者的统一解决方案,它从图像输入中学习世界模型,并利用它从想象的rollout中训练探索者策略和实现者策略。与之前通过到达先前访问过的状态进行探索的方法不同,探索者通过预见来计划发现未见过的令人惊讶的状态,这些状态随后被用作实现者练习的多样化目标。在无监督阶段之后,LEXA无需任何额外学习即可零样本解决指定为目标图像的任务。在先前的基准测试和包含跨四个标准机器人操作与运动控制领域共40个测试任务的全新挑战性基准上,LEXA都大幅优于以往的无监督目标到达方法。LEXA还能实现需要按顺序与多个物体交互的目标。最后,为了展示LEXA的可扩展性和通用性,我们在四个不同的环境中训练了单个通用智能体。代码和视频见 https://orybkin.github.io/lexa/

关键词

引用

@article{arxiv.2110.09514,
  title  = {Discovering and Achieving Goals via World Models},
  author = {Russell Mendonca and Oleh Rybkin and Kostas Daniilidis and Danijar Hafner and Deepak Pathak},
  journal= {arXiv preprint arXiv:2110.09514},
  year   = {2021}
}

备注

NeurIPS 2021. First two authors contributed equally. Website at https://orybkin.github.io/lexa/