$P^{3}O$:通过提示迁移视觉表示用于强化学习
计算机视觉与模式识别
2023-03-28 v2 人工智能
摘要
深度强化学习(DRL)算法将其学到的策略迁移到具有不同视觉输入的新环境十分重要。本文中,我们引入基于提示的近端策略优化(),一种三阶段 DRL 算法,通过应用提示将视觉表示从目标环境迁移到源环境。 的过程包含三个阶段:预训练、提示和预测。特别地,我们指定一个提示-Transformer 用于表示转换,并提出两步训练过程来为目标环境训练提示-Transformer,而 DRL 流水线的其余部分保持不变。我们实现了 并在 OpenAI CarRacing 视频游戏上评估它。实验结果表明 优于最先进的视觉迁移方案。特别地, 使学到的策略能在具有不同视觉输入的环境中表现良好,比在这些环境中重新训练策略有效得多。
引用
@article{arxiv.2303.12371,
title = {$P^{3}O$: Transferring Visual Representations for Reinforcement Learning via Prompting},
author = {Guoliang You and Xiaomeng Chu and Yifan Duan and Jie Peng and Jianmin Ji and Yu Zhang and Yanyong Zhang},
journal= {arXiv preprint arXiv:2303.12371},
year = {2023}
}
备注
This paper has been accepted to be presented at the upcoming IEEE International Conference on Multimedia & Expo (ICME) in 2023