中文

超越简单延迟奖励求和:面向强化学习的非马尔可夫奖励建模

机器学习 2024-10-29 v1

摘要

强化学习(RL)使智能体能够通过从奖励信号中学习来获取各种技能。不幸的是,设计高质量的实例级奖励通常需要大量的努力。一种新兴的替代方案,即延迟奖励强化学习,专注于从周期性呈现的奖励中学习,这些奖励可以通过人类评估者评估智能体在一系列行为上的表现来获得。然而,该领域的传统方法假设存在潜在的马尔可夫奖励,并且观察到的延迟奖励仅仅是实例级奖励的总和,这两种假设通常与现实世界场景不太吻合。在本文中,我们引入了复合延迟奖励强化学习(RLCoDe)问题,该问题通过消除强假设来推广传统的延迟奖励强化学习。我们认为,延迟奖励可能源于反映序列整体贡献的更复杂结构。为了解决这个问题,我们提出了一个用于建模复合延迟奖励的框架,使用非马尔可夫分量的加权和来捕捉各个步骤的不同贡献。在此框架基础上,我们提出了复合延迟奖励Transformer(CoDeTr),它结合了一种专门的序列内注意力机制来有效建模这些贡献。我们在具有挑战性的运动任务上进行了实验,其中智能体接收从可观测步骤奖励的复合函数计算出的延迟奖励。实验结果表明,CoDeTr在评估指标上始终优于基线方法。此外,我们证明它能有效识别序列中最显著的时间步,并准确预测能紧密反映环境反馈的奖励。

关键词

引用

@article{arxiv.2410.20176,
  title  = {Beyond Simple Sum of Delayed Rewards: Non-Markovian Reward Modeling for Reinforcement Learning},
  author = {Yuting Tang and Xin-Qiang Cai and Jing-Cheng Pang and Qiyu Wu and Yao-Xiang Ding and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:2410.20176},
  year   = {2024}
}