能否融合?强化学习中的值函数组合
机器学习
2018-07-13 v1 机器学习
摘要
终身学习型智能体的一个重要特性是能够组合已有技能以解决未见过的任务。然而,一般而言如何以原则性的方式组合技能仍不清楚。我们在熵正则化强化学习(RL)中提供了最优值函数组合的“配方”,并将其推广到标准 RL 设定。组合在一个视频游戏环境中得到演示,其中拥有一个已有策略库的智能体能够解决新任务而无需进一步学习。
引用
@article{arxiv.1807.04439,
title = {Will it Blend? Composing Value Functions in Reinforcement Learning},
author = {Benjamin van Niekerk and Steven James and Adam Earle and Benjamin Rosman},
journal= {arXiv preprint arXiv:1807.04439},
year = {2018}
}
备注
The 2nd Lifelong Learning: A Reinforcement Learning Approach (LLARLA) Workshop, Stockholm, Sweden, FAIM 2018