用逆强化学习重写历史:用于策略改进的后见之明推断
机器学习
2020-02-26 v1 人工智能
机器人学
机器学习
摘要
多任务强化学习(RL)旨在同时学习求解多个任务的策略。若干先前工作发现,用不同奖励函数重新标记过往经验可提升样本效率。重标记方法通常会问:若后见之明地假设我们的经验对某一任务是最优的,那么它对何任务最优?本文中,我们表明后见之明重标记即是逆 RL,这一观察提示我们可将逆 RL 与 RL 算法协同使用以高效求解多任务。我们利用该思想将先前工作中的目标重标记技术推广至任意类别的任务。我们的实验证实,利用逆 RL 重标记数据可加速一般多任务设定下的学习,包括目标到达、具有离散奖励集的域以及具有线性奖励函数的域。
引用
@article{arxiv.2002.11089,
title = {Rewriting History with Inverse RL: Hindsight Inference for Policy Improvement},
author = {Benjamin Eysenbach and Xinyang Geng and Sergey Levine and Ruslan Salakhutdinov},
journal= {arXiv preprint arXiv:2002.11089},
year = {2020}
}