面向演化奖励函数的离线时间感知学徒学习框架
机器学习
2023-05-17 v1
摘要
学徒学习(AL)是一种通过观察和模仿专家演示来推导有效决策策略的过程。然而,大多数现有 AL 方法并未设计用于处理以人为中心任务(如需要离线学习的医疗)中常见的演化奖励函数。本文中,我们提出一种离线时间感知分层 EM 基于能量的子轨迹(THEMES) AL 框架,以应对此类任务中的演化奖励函数。THEMES 的有效性通过一个具有挑战性的任务——脓毒症治疗进行评估。实验结果表明,THEMES 可显著优于具有竞争力的当前最优基线。
引用
@article{arxiv.2305.09070,
title = {An Offline Time-aware Apprenticeship Learning Framework for Evolving Reward Functions},
author = {Xi Yang and Ge Gao and Min Chi},
journal= {arXiv preprint arXiv:2305.09070},
year = {2023}
}