用于强化学习的首次占据表示
机器学习
2021-11-09 v3 人工智能
摘要
动物和人工智能体均受益于能够支持跨任务快速迁移学习、并使其能够高效穿越环境以到达奖励状态的状态表示。后继表示(SR)度量在固定策略下预期的累积折扣状态占据度,在其余条件不变的马尔可夫环境中能够实现向不同奖励结构的高效迁移,并被假设为生物行为和神经活动的基础。然而,在现实世界中,奖励可能移动或仅可被消耗一次,可能改变位置,或者智能体可能仅旨在尽快到达目标状态,而不受人为施加的任务期限约束。在这些情况下,最具行为相关性的表示应携带关于智能体何时可能首次到达感兴趣状态的信息,而非在潜在无限时间跨度内预期访问这些状态的频率。为反映此类需求,我们引入了首次占据表示(FR),它度量到达某状态首次被访问时的预期时间折扣。我们证明 FR 能够促进探索和选择到达期望状态的高效路径,使智能体在特定条件下能够规划由一系列子目标定义的可证明最优轨迹,并诱导出类似于动物躲避威胁刺激的行为。
引用
@article{arxiv.2109.13863,
title = {A First-Occupancy Representation for Reinforcement Learning},
author = {Ted Moskovitz and Spencer R. Wilson and Maneesh Sahani},
journal= {arXiv preprint arXiv:2109.13863},
year = {2021}
}