最大许可奖励机
机器学习
2024-08-16 v1 人工智能
摘要
奖励机允许为时间上扩展的任务和行为定义奖励。指定“信息丰富”的奖励机可能具有挑战性。解决此问题的一种方法是使用 AI 规划等技术,从学习环境的高级抽象描述中生成奖励机。然而,先前基于规划的方法基于单个(顺序或偏序)计划生成奖励机,并且不允许学习代理具有最大的灵活性。在本文中,我们提出了一种基于目标偏序计划集合来合成奖励机的新方法。我们证明,使用这种“最大许可”奖励机进行学习,比使用基于单个计划的奖励机进行学习能获得更高的奖励。我们展示了实验结果,这些结果支持我们的理论主张,表明我们的方法在实践中比单计划方法获得了更高的奖励。
引用
@article{arxiv.2408.08059,
title = {Maximally Permissive Reward Machines},
author = {Giovanni Varricchione and Natasha Alechina and Mehdi Dastani and Brian Logan},
journal= {arXiv preprint arXiv:2408.08059},
year = {2024}
}
备注
Paper accepted for publication at the European Conference on Artificial Intelligence (ECAI) 2024