中文

颠倒的强化学习:不预测奖励——直接将奖励映射为动作

人工智能 2020-06-24 v2 机器学习

摘要

我们将强化学习(RL)转化为一种监督学习(SL)形式,通过将传统RL颠倒过来,称之为颠倒 RL(UDRL)。标准RL预测奖励,而UDRL反而将奖励作为任务定义输入,连同时间范围表示以及其他可计算的历史与期望未来数据的函数一起使用。UDRL通过学习将这些输入观测解释为命令,通过SL在过往(可能是偶然的)经验上将命令映射为动作(或动作概率)。UDRL通过诸如“在至多这么多时间内获得大量奖励!”之类的输入命令,泛化以实现高奖励或其他目标。另一篇论文[63]关于UDRL的首次实验表明,即使是UDRL的试验版本也能在某些具有挑战性的RL问题上超越传统基线算法。我们还从概念上简化了一种[60]教机器人模仿人类的方法。首先录像人类模仿机器人当前的行为,然后让机器人通过SL学习将这些视频(作为输入命令)映射为这些行为,再让其泛化并模仿执行先前未知行为的人类视频。这种“模仿模仿者”概念实际上可能解释了生物进化为何产生了模仿婴儿咿呀学语的 parents。

关键词

引用

@article{arxiv.1912.02875,
  title  = {Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions},
  author = {Juergen Schmidhuber},
  journal= {arXiv preprint arXiv:1912.02875},
  year   = {2020}
}

备注

22 pages, 81 references