基于世界模型的自监督层次视觉推理
人工智能
2026-05-26 v2
摘要
3D 开放世界环境中的对抗性对手仍是强化学习的核心挑战,由于其庞大的状态空间。有效的推理表征在此类环境中至关重要。虽然现有的自监督视觉前瞻推理方法常因多步误差积累而不足,但许多研究通过注入领域特定知识来实现更稳定的引导。我们的关键洞察是,视觉推理表征的照片级保真度并非核心;真正重要的是提供信息丰富、与任务相关的信号。为此,我们提出 ResDreamer,一种层次化世界模型,其中每个高层次层针对下层的残差进行重构训练。这种设计使 progressively 地抽象出越来越复杂的世界动态,并促进更丰富的潜在表征的出现。drawing inspiration from the "Bitter Lesson", ResDreamer 以纯粹的自监督方式训练其推理表征。高层残差表征用于调制下层预测,使世界模型仅通过线性增加的跨层通信成本即可实现规模化。实验表明,ResDreamer 在样本效率和参数效率方面实现了最先进水平。这一可扩展的层次化视觉前瞻推理架构为在开放且动态的环境中构建更强大的在线 RL 代理铺平了道路。代码可在 https://github.com/XuYuanFei01/ResDreamer 访问。
引用
@article{arxiv.2605.17537,
title = {Self-supervised Hierarchical Visual Reasoning with World Model},
author = {Yuanfei Xu and Lin Liu and Wengang Zhou and Mingxiao Feng and Houqiang Li},
journal= {arXiv preprint arXiv:2605.17537},
year = {2026}
}