深度强化学习中的含噪符号抽象:以奖励机为例的研究
机器学习
2022-11-24 v2 人工智能
形式语言与自动机理论
摘要
自然语言与形式语言为人类指定指令和奖励函数提供了有效机制。我们研究当奖励函数以奖励机(一种日益流行的受自动机启发结构)所刻画的符号语言指定时,如何通过强化学习生成策略。我们关注从智能体视角看环境状态到符号(此处为奖励机)词汇的映射——通常称为标记函数——存在不确定性的情形。我们将含噪符号抽象下奖励机中的策略学习问题表述为一类特殊的POMDP优化问题,并基于已有及新技术研究若干解决方法,其中新技术侧重于预测奖励机状态而非单个符号的接地。我们分析这些方法,并在符号词汇正确解释的不同不确定性程度下进行了实验评估。我们在 illustrative 的玩具域以及部分可观测的深度RL域上通过实证调研验证了我们所提方法的优势及现有方法的局限。
引用
@article{arxiv.2211.10902,
title = {Noisy Symbolic Abstractions for Deep RL: A case study with Reward Machines},
author = {Andrew C. Li and Zizhao Chen and Pashootan Vaezipoor and Toryn Q. Klassen and Rodrigo Toro Icarte and Sheila A. McIlraith},
journal= {arXiv preprint arXiv:2211.10902},
year = {2022}
}
备注
NeurIPS Deep Reinforcement Learning Workshop 2022