MO2:基于模型的离线选项
机器学习
2022-09-07 v1 人工智能
机器人学
机器学习
摘要
从过往经验中发现有用行为并将其迁移到新任务的能力,被视为自然具身智能的核心组成部分。受神经科学启发,发现于瓶颈状态切换的行为长期以来被追求用于诱导跨任务最小描述长度的规划。先前的方法要么仅支持在线、同策略的瓶颈状态发现,限制了样本效率,要么局限于离散状态-动作域,限制了适用性。为此,我们引入基于模型的离线选项(MO2),一种支持在连续状态-动作空间上高效样本瓶颈选项发现的离线后见框架。一旦在源域上离线学得瓶颈选项,便在线迁移以提升迁移域上的探索与价值估计。我们的实验表明,在具有稀疏、延迟奖励的复杂长程连续控制任务上,MO2 的特性不可或缺,并带来超越近期选项学习方法的性能。额外的消融实验进一步展示了对选项可预测性与信用分配的影响。
引用
@article{arxiv.2209.01947,
title = {MO2: Model-Based Offline Options},
author = {Sasha Salter and Markus Wulfmeier and Dhruva Tirumala and Nicolas Heess and Martin Riedmiller and Raia Hadsell and Dushyant Rao},
journal= {arXiv preprint arXiv:2209.01947},
year = {2022}
}
备注
Accepted at 1st Conference on Lifelong Learning Agents (CoLLAs) Conference Track, 2022