关于强化学习用于 LTL 目标的(不)可计算性
人工智能
2022-06-28 v3 形式语言与自动机理论
机器学习
摘要
近年来,研究者们在制定针对线性时序逻辑(LTL)目标及 LTL 类目标的强化学习算法方面取得了显著进展。尽管如此,关于如何充分解决这一问题的根本局限性仍未得到充分探讨。以往的研究曾暗示过这一事实,但从理论角度深入考察却不多。本文从理论视角考察强化学习用于一般 LTL 目标的可计算性问题。在 PAC-MDP 框架下形式化该问题,这是衡量强化学习样本复杂度的标准框架。在该形式化下,我们证明,任一 LTL 公式的最优政策若且仅当该公式属于 LTL 层次结构中最为有限的类别(即在有限时域内可判定的公式)时,才为 PAC-MDP 可学习。在实践中,上述结果意味着当 LTL 目标不可在有限时域内判定时,任何强化学习算法都无法在无限制环境下通过有限次数互动获得其所学习政策性能的 PAC-MDP 保证。
引用
@article{arxiv.2111.12679,
title = {On the (In)Tractability of Reinforcement Learning for LTL Objectives},
author = {Cambridge Yang and Michael Littman and Michael Carbin},
journal= {arXiv preprint arXiv:2111.12679},
year = {2022}
}