强化学习中用于语义新颖性的基础模型
机器学习
2022-11-10 v1 人工智能
摘要
有效探索环境是强化学习(RL)中的一个关键挑战。我们通过定义一种基于基础模型(如对比语言图像预训练(CLIP))的新型内在奖励来应对这一挑战,该模型可以编码关于世界的丰富、领域无关的语义视觉-语言知识。具体来说,我们的内在奖励是基于预训练的CLIP嵌入定义的,无需在目标RL任务上进行任何微调或学习。我们证明,基于CLIP的内在奖励可以驱动探索朝向语义上有意义的状态,并在具有挑战性的稀疏奖励程序生成环境中优于当前最先进的方法。
引用
@article{arxiv.2211.04878,
title = {Foundation Models for Semantic Novelty in Reinforcement Learning},
author = {Tarun Gupta and Peter Karkus and Tong Che and Danfei Xu and Marco Pavone},
journal= {arXiv preprint arXiv:2211.04878},
year = {2022}
}
备注
Foundation Models for Decision Making Workshop at Neural Information Processing Systems, 2022