学习在没有动作的情况下行动
机器学习
2024-03-28 v2 人工智能
摘要
在海量网络数据上预训练大模型已被证明是在语言和视觉等领域获得强大通用模型的有效方法。然而,这一范式尚未在强化学习中站稳脚跟。这是因为视频作为网络上最丰富的具身行为数据形式,缺乏现有方法从演示中模仿行为所需的动作标签。我们引入了潜在动作策略(LAPO),这是一种纯粹从视频中恢复潜在动作信息,从而恢复潜在动作策略、世界模型和逆动力学模型的方法。LAPO 是第一种能够仅从观察到的动力学中恢复真实动作空间结构的方法,即使在具有挑战性的程序化生成环境中也是如此。LAPO 能够训练潜在动作策略,这些策略可以快速微调为专家级策略,既可以使用少量带动作标签的数据集离线微调,也可以使用奖励在线微调。LAPO 迈出了在网络上大量现成视频上预训练强大通用策略和世界模型的第一步。
引用
@article{arxiv.2312.10812,
title = {Learning to Act without Actions},
author = {Dominik Schmidt and Minqi Jiang},
journal= {arXiv preprint arXiv:2312.10812},
year = {2024}
}
备注
Accepted at ICLR 2024 (spotlight). The code can be found at http://github.com/schmidtdominik/LAPO