中文

$P^{3}O$:通过提示迁移视觉表示用于强化学习

计算机视觉与模式识别 2023-03-28 v2 人工智能

摘要

深度强化学习(DRL)算法将其学到的策略迁移到具有不同视觉输入的新环境十分重要。本文中,我们引入基于提示的近端策略优化(P3OP^{3}O),一种三阶段 DRL 算法,通过应用提示将视觉表示从目标环境迁移到源环境。P3OP^{3}O 的过程包含三个阶段:预训练、提示和预测。特别地,我们指定一个提示-Transformer 用于表示转换,并提出两步训练过程来为目标环境训练提示-Transformer,而 DRL 流水线的其余部分保持不变。我们实现了 P3OP^{3}O 并在 OpenAI CarRacing 视频游戏上评估它。实验结果表明 P3OP^{3}O 优于最先进的视觉迁移方案。特别地,P3OP^{3}O 使学到的策略能在具有不同视觉输入的环境中表现良好,比在这些环境中重新训练策略有效得多。

关键词

引用

@article{arxiv.2303.12371,
  title  = {$P^{3}O$: Transferring Visual Representations for Reinforcement Learning via Prompting},
  author = {Guoliang You and Xiaomeng Chu and Yifan Duan and Jie Peng and Jianmin Ji and Yu Zhang and Yanyong Zhang},
  journal= {arXiv preprint arXiv:2303.12371},
  year   = {2023}
}

备注

This paper has been accepted to be presented at the upcoming IEEE International Conference on Multimedia & Expo (ICME) in 2023