中文

一种面向递减奖励的状态表示

机器学习 2023-09-08 v1

摘要

多任务强化学习(RL)中的一个常见设定要求智能体快速适应从固定分布中随机采样的各种平稳奖励函数。在此类情形下,后继表示(SR)是一种流行的框架,它通过解耦策略的期望折扣累积状态占用与特定奖励函数,来支持快速策略评估。然而,在自然界中,序列任务很少是独立的,而是反映基于奖励刺激的可获得性与主观感知而变化的优先级。反映这一脱节,本文研究边际效用递减现象,并引入一种新颖的状态表示——λ\lambda 表示(λ\lambdaR),令人惊讶的是,它在该设定下是策略评估所必需的,并且推广了 SR 以及文献中的若干其他状态表示。我们确立了 λ\lambdaR 的形式化性质,并考察了其在机器学习中的规范优势,以及它用于研究自然行为(尤其是觅食)的效用。

关键词

引用

@article{arxiv.2309.03710,
  title  = {A State Representation for Diminishing Rewards},
  author = {Ted Moskovitz and Samo Hromadka and Ahmed Touati and Diana Borsa and Maneesh Sahani},
  journal= {arXiv preprint arXiv:2309.03710},
  year   = {2023}
}