中文

深度强化学习中跨多目标奖励函数的泛化

机器学习 2018-09-18 v1 机器学习

摘要

许多强化学习研究者将奖励函数视为环境的一部分,意味着智能体仅能在试运行中遇到某状态时得知该状态的奖励。然而,我们认为这是不必要的限制,相反,奖励函数应提供给学习算法。其优势在于算法随后可利用奖励函数检查智能体尚未遇到的状态的奖励。此外,算法可同时学习多个奖励函数的策略。对于每个状态,算法将使用各个奖励函数计算奖励并将奖励加入其经验回放数据集。Andrychowicz 等人(2017)开发的 Hindsight Experience Replay 算法正是如此,并学会在稀疏的、基于目标的奖励分布上泛化。我们将该算法推广至线性加权的多目标奖励,并学习可跨多目标奖励所有线性组合泛化的单一策略。其他多目标算法教导 Q 函数在奖励权重上泛化,而我们的算法使策略能够泛化,因此可用于连续动作。

关键词

引用

@article{arxiv.1809.06364,
  title  = {Generalizing Across Multi-Objective Reward Functions in Deep Reinforcement Learning},
  author = {Eli Friedman and Fred Fontaine},
  journal= {arXiv preprint arXiv:1809.06364},
  year   = {2018}
}

备注

9 pages, 4 figures