面向目标条件策略的反向学习
机器学习
2024-04-16 v2 人工智能
摘要
我们能否在没有奖励的情况下学习强化学习策略?我们能否仅通过尝试达到目标状态来学习策略?我们通过提出一个多步骤过程来肯定地回答这些问题:首先学习一个时间上反向的世界模型,其次生成达到目标的反向轨迹,然后使用最短路径查找算法改进这些序列,最后通过模仿学习训练神经网络策略。我们在一个确定性迷宫环境中评估我们的方法,其中观察是像素的鸟瞰图像,并表明它能够一致地达到多个目标。
引用
@article{arxiv.2312.05044,
title = {Backward Learning for Goal-Conditioned Policies},
author = {Marc Höftmann and Jan Robine and Stefan Harmeling},
journal= {arXiv preprint arXiv:2312.05044},
year = {2024}
}
备注
World Models, Goal-conditioned, Reward-free, Workshop on Goal-Conditioned Reinforcement Learning - NeurIPS 2023