SENSEI:由基础模型引导的语义探索以学习通用世界模型
人工智能
2025-06-30 v2
摘要
探索是强化学习(RL)的基石。内在动机方法旨在将探索从外部基于任务的奖励中解耦。然而,遵循信息增益等通用原则的既有方法往往仅揭示低层次的交互。在 contrast, children's play表明他们通过模仿或与看护人互动来进行有意义的高层次行为。近期研究聚焦于利用基础模型将这些语义偏差注入探索。然而,这些方法常依赖不切实际的假设,如语言嵌入的环境或高层次动作的访问。我们提出SEmaNtically Sensible ExploratIon(SENSEI),一个为基于模型的RL智能体提供语义有意义行为内在动机的框架。SENSEI通过从视觉语言模型(VLM)注释中提炼出有趣度奖励信号,使智能体能够通过世界模型预测这些奖励。在基于模型的RL中,SENSEI训练探索策略,以同时最大化语义奖励和不确定性。在机器人和类似视频游戏的仿真环境中,SENSEI能够从图像观察中发现多种有意义的行为,仅使用低层次动作。SENSEI为从基础模型反馈中学习提供了通用工具,这是VLm日益强大的关键研究方向。
引用
@article{arxiv.2503.01584,
title = {SENSEI: Semantic Exploration Guided by Foundation Models to Learn Versatile World Models},
author = {Cansu Sancaktar and Christian Gumbsch and Andrii Zadaianchuk and Pavel Kolev and Georg Martius},
journal= {arXiv preprint arXiv:2503.01584},
year = {2025}
}
备注
ICML 2025 camera-ready version. Project webpage at https://sites.google.com/view/sensei-paper