带有决策值的模块化多目标深度强化学习
人工智能
2018-02-26 v2 机器人学
摘要
在本工作中,我们提出一种在多目标环境中使用深度Q网络(DQN)的方法。深度Q网络在从高级视觉状态表示中学习的单目标问题中提供了卓越性能。然而,在许多场景(如机器人、游戏)中,智能体需要同时追求多个目标。我们提出一种架构,其中使用分离的DQN来控制智能体针对特定目标的行为。在该架构中,我们引入决策值以改进多个DQN标量化成为单一动作的过程。我们的架构能够将智能体的行为分解为由不同模块学习的可控且可替换的子行为。此外,它允许在学习后改变特定目标的优先级,同时保持智能体的整体性能。为评估我们的方案,我们使用了一个类游戏模拟器,其中智能体——提供高级视觉输入——在2D世界中追求多个目标。
引用
@article{arxiv.1704.06676,
title = {Modular Multi-Objective Deep Reinforcement Learning with Decision Values},
author = {Tomasz Tajmajer},
journal= {arXiv preprint arXiv:1704.06676},
year = {2018}
}