从像素出发的深度分层规划
人工智能
2022-06-10 v1 机器学习
机器人学
机器学习
摘要
智能体需要选择长序列动作以解决复杂任务。人类轻易将任务分解为子目标并通过数百万次肌肉指令达成,而当前人工智能受限于仅数百步决策视野的任务,尽管拥有大量计算预算。分层强化学习研究旨在克服此局限,但已被证明颇具挑战,现有方法依赖人工指定目标空间或子任务,且不存在通用解法。我们提出Director,一种通过在学习世界模型的潜空间内规划、直接从像素学习分层行为的实用方法。高层策略通过选择潜在目标最大化任务与探索奖励,低层策略学习达成这些目标。尽管在潜空间运作,决策可解释,因为世界模型可将目标解码为图像以供可视化。Director在稀疏奖励任务上优于探索方法,包括四足机器人从自我中心相机与本体感知进行的3D迷宫遍历,且无需 prior work 所使用的全局位置或俯视图。Director还在广泛环境中学习到成功行为,包括视觉控制、Atari游戏与DMLab关卡。
引用
@article{arxiv.2206.04114,
title = {Deep Hierarchical Planning from Pixels},
author = {Danijar Hafner and Kuang-Huei Lee and Ian Fischer and Pieter Abbeel},
journal= {arXiv preprint arXiv:2206.04114},
year = {2022}
}
备注
Website: https://danijar.com/director