噪声与不确定环境中的深度强化学习奖励机器
机器学习
2025-01-16 v4 人工智能
形式语言与自动机理论
摘要
奖励机器提供了一种自动机启发的结构,用于指定指令、安全约束和其他时间上延展的值得奖励的行为。通过暴露奖励函数的底层结构,它们使得强化学习任务的分解成为可能,从而在样本效率上取得了令人印象深刻的提升。尽管奖励机器和类似的形式化规范在序列决策问题中有着丰富的应用历史,但它们关键依赖于对构成奖励函数构建块的领域特定词汇的真实解释——由于部分可观测性和噪声感知,这种真实解释在现实世界中是难以获得的。在这项工作中,我们探索了在噪声和不确定环境中使用奖励机器进行深度强化学习。我们将此问题描述为部分可观测马尔可夫决策过程(POMDP),并提出了一套在领域特定词汇解释不确定的情况下利用任务结构的强化学习算法。通过理论和实验,我们揭示了朴素方法中的陷阱,同时展示了如何在词汇的噪声解释下成功利用任务结构。
引用
@article{arxiv.2406.00120,
title = {Reward Machines for Deep RL in Noisy and Uncertain Environments},
author = {Andrew C. Li and Zizhao Chen and Toryn Q. Klassen and Pashootan Vaezipoor and Rodrigo Toro Icarte and Sheila A. McIlraith},
journal= {arXiv preprint arXiv:2406.00120},
year = {2025}
}