强化学习中的最大奖励公式化
机器学习
2023-12-20 v2 人工智能
机器学习
摘要
强化学习(RL)算法通常处理最大化期望累积回报(折扣或无折扣、有限或无限时域)。然而,现实世界中的若干关键应用(如药物发现)并不适用于该框架,因为 RL 智能体只需在一条轨迹中识别出获得最高奖励的状态(分子),而无需优化期望累积回报。在本工作中,我们公式化了一个目标函数以最大化轨迹上的期望最大奖励,推导了贝尔曼方程的一种新颖函数形式,引入了相应的贝尔曼算子,并给出了收敛性证明。使用该公式化方法,我们在模拟真实世界药物发现流程的分子生成任务上取得了最先进(SOTA)的结果。
引用
@article{arxiv.2010.03744,
title = {Maximum Reward Formulation In Reinforcement Learning},
author = {Sai Krishna Gottipati and Yashaswi Pathak and Rohan Nuttall and Sahir and Raviteja Chunduru and Ahmed Touati and Sriram Ganapathi Subramanian and Matthew E. Taylor and Sarath Chandar},
journal= {arXiv preprint arXiv:2010.03744},
year = {2023}
}
备注
14 pages, 5 figures Update based on reviewer feedback