中文

强化学习中的最大奖励公式化

机器学习 2023-12-20 v2 人工智能 机器学习

摘要

强化学习(RL)算法通常处理最大化期望累积回报(折扣或无折扣、有限或无限时域)。然而,现实世界中的若干关键应用(如药物发现)并不适用于该框架,因为 RL 智能体只需在一条轨迹中识别出获得最高奖励的状态(分子),而无需优化期望累积回报。在本工作中,我们公式化了一个目标函数以最大化轨迹上的期望最大奖励,推导了贝尔曼方程的一种新颖函数形式,引入了相应的贝尔曼算子,并给出了收敛性证明。使用该公式化方法,我们在模拟真实世界药物发现流程的分子生成任务上取得了最先进(SOTA)的结果。

关键词

引用

@article{arxiv.2010.03744,
  title  = {Maximum Reward Formulation In Reinforcement Learning},
  author = {Sai Krishna Gottipati and Yashaswi Pathak and Rohan Nuttall and Sahir and Raviteja Chunduru and Ahmed Touati and Sriram Ganapathi Subramanian and Matthew E. Taylor and Sarath Chandar},
  journal= {arXiv preprint arXiv:2010.03744},
  year   = {2023}
}

备注

14 pages, 5 figures Update based on reviewer feedback