通过最大化证据进行动作推断:基于世界模型从观察中实现零样本模仿
机器学习
2023-12-05 v1 人工智能
摘要
大多数强化学习智能体需要大量不切实际的环境交互才能学习新行为,与此不同的是,人类仅通过观察和模仿他人就能擅长快速学习。这种能力在很大程度上取决于这样一个事实:人类拥有自身具身模型,使其能够推断出导致所观察行为的最可能动作。在本文中,我们提出了通过最大化证据进行动作推断(AIME),以使用世界模型复现这种行为。AIME 包含两个不同的阶段。在第一阶段,智能体从其过往经验中学习世界模型,通过最大化 ELBO 来理解自身的身体。而在第二阶段,智能体被给予一些仅包含观察结果的专家执行新任务的演示,并试图模仿专家的行为。AIME 通过将策略定义为推断模型,并最大化该策略和世界模型下演示的证据来实现这一点。我们的方法是“零样本”的,即在给定演示后,不需要对世界模型进行进一步训练或与环境进行在线交互。我们在 DeepMind Control Suite 的 Walker 和 Cheetah 具身上实证验证了我们方法的零样本模仿性能,发现其优于最先进的基线。代码获取地址:https://github.com/argmax-ai/aime。
引用
@article{arxiv.2312.02019,
title = {Action Inference by Maximising Evidence: Zero-Shot Imitation from Observation with World Models},
author = {Xingyuan Zhang and Philip Becker-Ehmck and Patrick van der Smagt and Maximilian Karl},
journal= {arXiv preprint arXiv:2312.02019},
year = {2023}
}
备注
NeurIPS 2023