MapGo:面向目标导向任务的模型辅助策略优化
人工智能
2021-05-14 v1 机器学习
摘要
在目标导向强化学习中,将过往经验中的原始目标重新标注以赋予智能体后见之明能力,是解决奖励稀疏问题的主要方案。本文为增强重标注目标的多样性,开发了 FGI(Foresight Goal Inference,前瞻目标推断),一种通过习得动力学模型展望未来来重标注目标的新策略。此外,为提高样本效率,我们提出利用动力学模型生成模拟轨迹用于策略训练。结合这两点改进,我们引入了 MapGo 框架(Model-Assisted Policy Optimization for Goal-oriented tasks,面向目标导向任务的模型辅助策略优化)。实验中,我们首先展示了 FGI 策略相较于后见之明策略的有效性,随后表明在一组复杂任务上 MapGo 框架相较于无模型基线实现了更高的样本效率。
引用
@article{arxiv.2105.06350,
title = {MapGo: Model-Assisted Policy Optimization for Goal-Oriented Tasks},
author = {Menghui Zhu and Minghuan Liu and Jian Shen and Zhicheng Zhang and Sheng Chen and Weinan Zhang and Deheng Ye and Yong Yu and Qiang Fu and Wei Yang},
journal= {arXiv preprint arXiv:2105.06350},
year = {2021}
}
备注
Paper accepted at IJCAI 2021