基于块奖励的视觉模仿学习
人工智能
2023-02-14 v2
摘要
视觉模仿学习使强化学习智能体能够从专家视觉演示(如视频或图像序列)中学习行为,而无需显式且定义良好的奖励。以往研究要么采用监督学习技术,要么从像素中导出简单且粗糙的标量奖励,忽视了图像演示中包含的密集信息。在本工作中,我们提出度量图像样本各个局部区域(或称块)的专业程度,并相应地恢复多维的块奖励。块奖励是一种更精确的奖励刻画,可作为细粒度的专业程度度量与视觉可解释性工具。具体地,我们提出基于块奖励的对抗模仿学习(PatchAIL),其采用基于块的判别器来度量给定图像中不同局部部分的专业程度并提供块奖励。基于块的知识也被用于正则化聚合奖励并稳定训练。我们在 DeepMind Control Suite 和 Atari 任务上评估了我们的方法。实验结果表明 PatchAIL 优于基线方法,并为视觉演示提供了有价值的解释。
引用
@article{arxiv.2302.00965,
title = {Visual Imitation Learning with Patch Rewards},
author = {Minghuan Liu and Tairan He and Weinan Zhang and Shuicheng Yan and Zhongwen Xu},
journal= {arXiv preprint arXiv:2302.00965},
year = {2023}
}
备注
Accepted by ICLR 2023. 18 pages, 14 figures, 2 tables. Codes are available at https://github.com/sail-sg/PatchAIL