学习单一表征以优化所有奖励
机器学习
2021-10-12 v3 人工智能
最优化与控制
摘要
我们引入无奖励马尔可夫决策过程动力学的前向后向(FB)表征。它针对任何后验指定的奖励提供显式的近最优策略。在无监督阶段,我们利用与环境无奖励的交互,通过现成的深度学习方法与时序差分(TD)学习来学习两种表征。在测试阶段,奖励表征由观测或显式奖励描述(例如目标状态)估计得到。该奖励对应的最优策略直接从这些表征获得,无需规划。我们假设第一阶段可访问探索方案或回放缓冲区。相应的无监督损失具有良好原则性:若训练完美,所得策略对任意奖励函数可证明为最优;若训练不完美,次优性与无监督近似误差成正比。FB 表征通过预测占据图学习状态与动作间的长程关系,而无需如基于模型的方法那样合成状态。这是朝在任意黑盒随机环境中学习可控智能体迈出的一步。该方法在离散与连续迷宫、基于像素的 MsPacman 以及 FetchReach 虚拟机械臂上均优于目标导向 RL 算法。我们还展示了该智能体如何立即适应超越目标导向 RL 的新任务。
引用
@article{arxiv.2103.07945,
title = {Learning One Representation to Optimize All Rewards},
author = {Ahmed Touati and Yann Ollivier},
journal= {arXiv preprint arXiv:2103.07945},
year = {2021}
}