基于最优性保持翻译的 LTL 与 $\omega$-正则目标强化学习
机器学习
2024-10-17 v1 人工智能
摘要
线性时序逻辑(LTL)以及更广泛的 -正则目标是传统折扣和平均奖励目标的替代方案,具有更大的可解释性优势。本文研究了这些目标之间的关系。我们的主要结果是:每个针对 -正则目标的强化学习问题都可以通过(有限记忆)奖励机器进行一次保持最优性的折扣求解,将其归约为平均奖励问题。此外,我们通过展示最优政策可通过近似求解一系列折扣求和问题来渐进地找到,从而证明了这一方法的有效性。因此,我们解决了一个开放问题:LTL 和 -正则目标的最优政策可被渐进学习。
关键词
引用
@article{arxiv.2410.12175,
title = {Reinforcement Learning with LTL and $\omega$-Regular Objectives via Optimality-Preserving Translation to Average Rewards},
author = {Xuan-Bach Le and Dominik Wagner and Leon Witzman and Alexander Rabinovich and Luke Ong},
journal= {arXiv preprint arXiv:2410.12175},
year = {2024}
}