中文

深度强化学习中的含噪符号抽象:以奖励机为例的研究

机器学习 2022-11-24 v2 人工智能 形式语言与自动机理论

摘要

自然语言与形式语言为人类指定指令和奖励函数提供了有效机制。我们研究当奖励函数以奖励机(一种日益流行的受自动机启发结构)所刻画的符号语言指定时,如何通过强化学习生成策略。我们关注从智能体视角看环境状态到符号(此处为奖励机)词汇的映射——通常称为标记函数——存在不确定性的情形。我们将含噪符号抽象下奖励机中的策略学习问题表述为一类特殊的POMDP优化问题,并基于已有及新技术研究若干解决方法,其中新技术侧重于预测奖励机状态而非单个符号的接地。我们分析这些方法,并在符号词汇正确解释的不同不确定性程度下进行了实验评估。我们在 illustrative 的玩具域以及部分可观测的深度RL域上通过实证调研验证了我们所提方法的优势及现有方法的局限。

关键词

引用

@article{arxiv.2211.10902,
  title  = {Noisy Symbolic Abstractions for Deep RL: A case study with Reward Machines},
  author = {Andrew C. Li and Zizhao Chen and Pashootan Vaezipoor and Toryn Q. Klassen and Rodrigo Toro Icarte and Sheila A. McIlraith},
  journal= {arXiv preprint arXiv:2211.10902},
  year   = {2022}
}

备注

NeurIPS Deep Reinforcement Learning Workshop 2022