零样态强化学习:在部分可观测性下
机器学习
2025-06-19 v1 人工智能
摘要
最近的工作表明,在某些假设下,零样态强化学习(RL)方法可在奖励-free 预训练后推广到环境中任何未见任务。访问马尔可夫状态是一种此类假设,但在许多实际应用中,马尔可夫状态仅部分可观测。本文探讨了标准零样态 RL 方法在遭受部分可观测性时性能如何退化,表明与单任务 RL 中一样,基于记忆的架构是有效的补救措施。我们在状态、奖励和动力学发生变化且部分可观测的领域中评估了基于记忆的零样态 RL 方法,在这些领域中表现出优于无记忆基线的改进。我们的代码已通过 https://enjeeneer.io/projects/bfms-with-memory/ 对外开源。
引用
@article{arxiv.2506.15446,
title = {Zero-Shot Reinforcement Learning Under Partial Observability},
author = {Scott Jeen and Tom Bewley and Jonathan M. Cullen},
journal= {arXiv preprint arXiv:2506.15446},
year = {2025}
}
备注
Reinforcement Learning Conference 2025