基于奖励经验充分性的延迟奖励校准
机器学习
2021-08-26 v3
摘要
对延迟奖励进行恰当的信用分配是强化学习的一项基本挑战。为解决该问题,我们从分类视角出发引入了一种延迟奖励校准范式。我们假设,由于包含相同或等价的关键信息,良好表示的状态向量彼此之间具有相似性。为此,我们定义了经验充分分布,该分布内的状态向量将引导智能体在后续步骤中获得环境奖励信号。进而设计了一个经纯化训练的分类器来获取该分布并生成校准后的奖励。我们通过跟踪实时提取过程并在环境中构建不同的奖励函数来检验充分状态提取的正确性。结果表明,该分类器能够生成及时且准确的校准奖励。此外,这些奖励能够使模型训练过程更加高效。最后,我们指出并讨论了由我们的模型提取出的充分状态与人类观察结果相呼应。
引用
@article{arxiv.2102.10527,
title = {Delayed Rewards Calibration via Reward Empirical Sufficiency},
author = {Yixuan Liu and Hu Wang and Xiaowei Wang and Xiaoyue Sun and Liuyue Jiang and Minhui Xue},
journal= {arXiv preprint arXiv:2102.10527},
year = {2021}
}