多目标强化学习
机器学习
2018-06-27 v1 人工智能
机器学习
摘要
全目标更新利用 Q-learning 的离策略特性,从世界中的每次转移更新智能体可能拥有的所有目标,由 Kaelbling (1993) 引入强化学习(RL)。在先前工作中,这主要在允许表格表示且所有可行目标可被显式枚举并分别学习的小状态 RL 问题中被探索。本文中,我们在深度神经网络 RL(简称 DeepRL)背景下实证探索了更新多(而非全)目标这一思想的 3 种不同扩展。首先,在 Kaelbling 方法的直接适配中,我们探索多目标更新是否可用于在非表格视觉观测领域达到精通。其次,我们探索多目标更新是否可用于预训练网络,以随后在单一主任务上学习得更快更好。第三,我们探索多目标更新是否可用于在训练网络以在单一主任务上学习得更快更好时提供辅助任务更新。我们对三种扩展的每一种都提供了与基线的比较。
引用
@article{arxiv.1806.09605,
title = {Many-Goals Reinforcement Learning},
author = {Vivek Veeriah and Junhyuk Oh and Satinder Singh},
journal= {arXiv preprint arXiv:1806.09605},
year = {2018}
}