中文

MORE-3S:具有共享语义空间的多模态离线强化学习

人工智能 2024-02-21 v1 计算机科学与博弈论

摘要

基于将不同模态对齐到同一语义嵌入空间将使模型更容易理解状态和动作这一直觉,我们为离线强化学习 (RL) 挑战提出了一种新视角。更具体地说,通过整合多模态和预训练语言模型,我们将该问题转化为监督学习任务。我们的方法结合了源自图像的状态信息和源自文本的动作相关数据,从而增强了 RL 训练性能并促进了长期战略思维。我们强调了对语言的上下文理解,并展示了通过将状态和动作的表示与语言的表示对齐,RL 中的决策如何受益。在 Atari 和 OpenAI Gym 环境上进行的评估证明,我们的方法显著优于当前基线。这有助于推进离线 RL 的性能和效率,同时为离线 RL 提供了新颖的视角。我们的代码和数据可在 https://github.com/Zheng0428/MORE_ 获取。

关键词

引用

@article{arxiv.2402.12845,
  title  = {MORE-3S:Multimodal-based Offline Reinforcement Learning with Shared Semantic Spaces},
  author = {Tianyu Zheng and Ge Zhang and Xingwei Qu and Ming Kuang and Stephen W. Huang and Zhaofeng He},
  journal= {arXiv preprint arXiv:2402.12845},
  year   = {2024}
}