中文

用于时间信用分配的自适应成对权重

机器学习 2022-06-07 v2 人工智能

摘要

在某一状态下采取的行动应因未来奖励获得多少信用(或责备)?这是强化学习(RL)中基本的时间信用分配问题。最早且仍最广泛使用的启发式方法之一是基于一个标量系数 λ\lambda(作为超参数)对状态-动作与奖励之间的时间间隔求幂来分配该信用。在这篇实证论文中,我们探索基于更一般的成对权重的启发式方法,这些权重是所采取动作的状态、奖励时刻的状态以及两者之间时间间隔的函数。当然,这些成对权重函数应该是什么并不清楚,并且由于它们过于复杂而无法作为超参数处理,我们开发了一种元梯度过程,在策略的常规 RL 训练期间学习这些权重函数。我们的实证工作表明,通常在策略学习过程中学习这些成对权重函数能够达到优于竞争方法的性能。

关键词

引用

@article{arxiv.2102.04999,
  title  = {Adaptive Pairwise Weights for Temporal Credit Assignment},
  author = {Zeyu Zheng and Risto Vuorio and Richard Lewis and Satinder Singh},
  journal= {arXiv preprint arXiv:2102.04999},
  year   = {2022}
}

备注

AAAI 2022. The first two authors contributed equally