从含噪标签中学习鲁棒的奖励机
人工智能
2025-03-24 v2 机器学习
摘要
本文提出了PROB-IRM,一种从含噪执行轨迹中为强化学习智能体学习鲁棒奖励机的方法。奖励机驱动的强化学习的关键方面是利用一个有限状态机,将智能体的任务分解为不同的子任务。PROB-IRM使用一种对含噪示例鲁棒的最先进的归纳逻辑编程框架,利用贝叶斯后验置信度从含噪轨迹中学习奖励机,从而确保对不一致性的鲁棒性。结果的关键在于奖励机学习和策略学习之间的交错:每当强化学习智能体生成一条被认为不被当前奖励机接受的轨迹时,就会学习一个新的奖励机。为了加速强化学习智能体的训练,PROB-IRM采用了一种基于概率的奖励塑形公式,该公式使用从轨迹中推导出的后验贝叶斯信念。我们的实验分析表明,PROB-IRM可以从含噪轨迹中学习(可能不完美的)奖励机,并利用它们来训练强化学习智能体成功解决其任务。尽管从含噪轨迹中学习奖励机具有复杂性,但使用PROB-IRM训练的智能体与使用手工制作的奖励机的智能体表现相当。
引用
@article{arxiv.2408.14871,
title = {Learning Robust Reward Machines from Noisy Labels},
author = {Roko Parac and Lorenzo Nodari and Leo Ardon and Daniel Furelos-Blanco and Federico Cerutti and Alessandra Russo},
journal= {arXiv preprint arXiv:2408.14871},
year = {2025}
}
备注
Accepted at the 21st International Conference on Principles of Knowledge Representation and Reasoning (KR 2024)