基于少样本标注的以对象为中心的世界模型用于样本高效的强化学习
机器学习
2026-02-26 v2 计算机视觉与模式识别
摘要
尽管基于像素的深度强化学习(RL)取得了显著成功,但其样本效率低下仍是实际应用中的关键限制。基于模型的强化学习(MBRL)通过学习世界模型以生成模拟经验来解决此问题,但依赖像素级重建损失的标准方法往往无法在复杂、动态的场景中捕捉到对任务至关重要的小物体。我们假设以对象为中心(OC)的表示可以将模型容量导向具有语义意义的实体,从而改善动力学预测和样本效率。在本工作中,我们引入了 OC-STORM,这是一个以对象为中心的 MBRL 框架,它通过预训练分割网络提取的对象表示来增强所学的世界模型。通过以最少数量的标注帧为条件,OC-STORM 能够学习跟踪与决策相关的对象动力学及对象间交互,而无需大量标注或访问特权信息。实证结果表明,OC-STORM 在 Atari 100k 基准上显著优于 STORM 基线,并在视觉复杂的游戏《空洞骑士》中极具挑战的 Boss 战上实现了 SOTA 的样本效率。我们的发现强调了将 OC 先验集成到 MBRL 中以应对复杂视觉领域的潜力。项目页面:https://oc-storm.weipuzhang.com
引用
@article{arxiv.2501.16443,
title = {Object-Centric World Models from Few-Shot Annotations for Sample-Efficient Reinforcement Learning},
author = {Weipu Zhang and Adam Jelley and Trevor McInroe and Amos Storkey and Gang Wang},
journal= {arXiv preprint arXiv:2501.16443},
year = {2026}
}