用于强化学习的符号状态划分
机器学习
2025-02-05 v3 人工智能
摘要
表格型强化学习方法无法直接在连续状态空间上运行。解决此问题的一种方法是对状态空间进行划分。良好的划分能够在学习过程中实现泛化,并更高效地利用先前经验。因此,学习过程变得更快,并产生更可靠的策略。然而,划分引入了近似,这在状态分量之间存在非线性关系时尤为有害。理想的划分应在给定问题下尽可能粗糙,同时捕获状态空间的关键结构。本工作通过符号执行从环境动力学中提取划分。我们表明,符号划分改善了关于环境行为的状态空间覆盖率,并使强化学习在稀疏奖励下表现更好。我们从精度、可扩展性、学习智能体性能以及所学策略的状态空间覆盖率方面评估了符号状态空间划分。
引用
@article{arxiv.2409.16791,
title = {Symbolic State Partitioning for Reinforcement Learning},
author = {Mohsen Ghaffari and Mahsa Varshosaz and Einar Broch Johnsen and Andrzej Wąsowski},
journal= {arXiv preprint arXiv:2409.16791},
year = {2025}
}