中文

神经奖励机器

机器学习 2024-08-19 v1 人工智能

摘要

非马尔可夫型强化学习(RL)任务非常难以解决,因为代理必须考虑整个状态-动作对的历史才能在环境中作出理性决策。大多数工作使用符号形式(如线性时序逻辑或自动机)来指定时延扩展任务。这些方法仅适用于有限且离散的状态环境,或适用于连续问题,其中已知从原始状态到符号解释之间的映射(称为符号 grounding(SG)函数)。本文定义了神经奖励机器(NRM),这是一种基于概率松弛的Moore机器的自动机-神经符号框架,可用于在非符号非马尔可夫型RL领域进行推理和学习。我们将RL与准监督符号 grounding(SSSG)相结合,我们展示了NRM可以在没有SG函数知识的情况下,在非符号环境中利用高级符号知识,超越无法包含先验知识的深度RL方法。此外,我们推进了SSSG研究,提出了一种用于分析时序规范可groundability的算法,其效率比基线技术高出约10310^3倍。

关键词

引用

@article{arxiv.2408.08677,
  title  = {Neural Reward Machines},
  author = {Elena Umili and Francesco Argenziano and Roberto Capobianco},
  journal= {arXiv preprint arXiv:2408.08677},
  year   = {2024}
}