中文

强化学习中用于语义新颖性的基础模型

机器学习 2022-11-10 v1 人工智能

摘要

有效探索环境是强化学习(RL)中的一个关键挑战。我们通过定义一种基于基础模型(如对比语言图像预训练(CLIP))的新型内在奖励来应对这一挑战,该模型可以编码关于世界的丰富、领域无关的语义视觉-语言知识。具体来说,我们的内在奖励是基于预训练的CLIP嵌入定义的,无需在目标RL任务上进行任何微调或学习。我们证明,基于CLIP的内在奖励可以驱动探索朝向语义上有意义的状态,并在具有挑战性的稀疏奖励程序生成环境中优于当前最先进的方法。

关键词

引用

@article{arxiv.2211.04878,
  title  = {Foundation Models for Semantic Novelty in Reinforcement Learning},
  author = {Tarun Gupta and Peter Karkus and Tong Che and Danfei Xu and Marco Pavone},
  journal= {arXiv preprint arXiv:2211.04878},
  year   = {2022}
}

备注

Foundation Models for Decision Making Workshop at Neural Information Processing Systems, 2022