用于行为迁移学习的正则化软 actor-critic
机器学习
2022-09-28 v1
摘要
现有模仿学习方法主要关注使智能体有效模仿示教行为,但未解决行为风格与任务目标之间潜在的矛盾。总体上缺乏允许智能体在不同程度部分模仿示教行为的同时完成主要任务目标的高效方法。本文提出一种称为正则化软 Actor-Critic 的方法,其在约束马尔可夫决策过程框架(CMDP)下表述主任务与模仿任务。主任务定义为软 Actor-Critic(SAC)中使用的最大熵目标,模仿任务定义为约束。我们在与视频游戏应用相关的连续控制任务上评估了我们的方法。
引用
@article{arxiv.2209.13224,
title = {Regularized Soft Actor-Critic for Behavior Transfer Learning},
author = {Mingxi Tan and Andong Tian and Ludovic Denoyer},
journal= {arXiv preprint arXiv:2209.13224},
year = {2022}
}
备注
13 pages, 5 figures, paper accepted by IEEE CoG2022