中文

论强化学习中目标规范形式体系的表达能力

机器学习 2024-02-20 v2

摘要

强化学习(RL)中的大多数算法要求目标以马尔可夫奖励函数的形式形式化。然而,众所周知某些任务无法用马尔可夫奖励形式体系中的目标表达,这推动了对RL中替代性目标规范形式体系的研究,如线性时序逻辑和多目标强化学习。迄今为止,尚未有对这些形式体系在表达能力上相互关系的透彻分析。我们通过提供对17种显著目标规范形式体系的全面比较,填补了现有文献中的这一空白。我们基于这些形式体系的表达能力将它们置于一个预序中,并将该预序呈现为哈斯图。我们发现了不同形式体系的多种局限性,并论证没有任何一种形式体系既具有主导性的表达能力又能用现有技术直接优化。例如,我们证明正则化RL、(外)非线性马尔可夫奖励、奖励机、线性时序逻辑和极限平均奖励各自都能表达其他形式体系无法表达的任务。我们结果的意义有两方面。首先,我们识别出在为策略优化指定目标时需要考虑的重要表达能力局限。其次,我们的结果凸显了未来研究的必要性,即调整奖励学习以适配更多样的形式体系,因为许多现有奖励学习方法假设期望目标采取马尔可夫形式。我们的工作有助于更连贯地理解不同RL目标规范形式体系的代价与收益。

关键词

引用

@article{arxiv.2310.11840,
  title  = {On The Expressivity of Objective-Specification Formalisms in Reinforcement Learning},
  author = {Rohan Subramani and Marcus Williams and Max Heitmann and Halfdan Holm and Charlie Griffin and Joar Skalse},
  journal= {arXiv preprint arXiv:2310.11840},
  year   = {2024}
}

备注

Published as a conference paper at ICLR 2024