中文

通过奖励预测状态表示协调奖励

人工智能 2022-02-01 v1 机器学习

摘要

预测状态表示(PSRs)是受控非马尔可夫观测序列的模型,其展现出与 POMDP 观测相同的生成过程,而不依赖潜在状态。就此而言,PSR 与相应的 POMDP 不可区分。然而,PSR notoriously 忽略奖励概念,这削弱了 PSR 模型在控制、规划或强化学习中的通用效用。因此,我们描述了一个充分必要的准确性条件,用以判定 PSR 能否准确建模 POMDP 奖励;我们展示了即使准确性条件不满足,奖励也可被近似;并且发现来自知名第三方仓库的不少 POMDP 不满足该准确性条件。我们提出奖励预测状态表示(R-PSRs),作为 PSR 的推广,可准确建模观测与奖励,并为 R-PSR 开发了值迭代。我们展示了最优 POMDP 策略与基于近似奖励导出的最优 PSR 策略之间存在不匹配。另一方面,最优 R-PSR 策略与最优 POMDP 策略完全匹配,再次确认 R-PSR 作为观测与奖励的准确无状态生成模型。

关键词

引用

@article{arxiv.2106.03926,
  title  = {Reconciling Rewards with Predictive State Representations},
  author = {Andrea Baisero and Christopher Amato},
  journal= {arXiv preprint arXiv:2106.03926},
  year   = {2022}
}

备注

IJCAI 2021