基于姿态-free 分层记忆扩展至 1000 帧视野的交互式世界模型
计算机视觉与模式识别
2026-02-04 v2 人工智能
摘要
我们提出 Infinite-World,一种能够在复杂真实环境中维持 1000 帧以上连贯视觉记忆的鲁棒交互式世界模型。虽然现有世界模型可在具有完美真实坐标的合成数据上高效优化,但由于噪声姿态估计和视角回访稀缺,缺乏针对真实视频的有效训练范式。为弥合这一差距,我们首先引入层次化姿态-free 记忆压缩器 (HPMC),递归地将历史潜在表示压缩到固定预算。通过联合优化压缩器与生成式主干,HPMC 使模型能够在计算成本受限的情况下自主锚定远古生成,无需显式几何先验。其次,我们提出不确定性感知动作标注模块,将连续运动离散化为三状态逻辑。该策略最大化地利用原始视频数据,同时将确定性动作空间从噪声轨迹中保护,确保稳健的动作-响应学习。进一步,基于我们来自初步玩具研究的洞见,我们采用基于回访-稠密微调策略,使用紧凑的 30 分钟数据集高效激活模型的长程环路闭合能力。广泛的实验,包括客观指标和用户研究,表明 Infinite-World 在视觉质量、动作可控性和空间一致性方面实现了卓越的性能。
引用
@article{arxiv.2602.02393,
title = {Infinite-World: Scaling Interactive World Models to 1000-Frame Horizons via Pose-Free Hierarchical Memory},
author = {Ruiqi Wu and Xuanhua He and Meng Cheng and Tianyu Yang and Yong Zhang and Zhuoliang Kang and Xunliang Cai and Xiaoming Wei and Chunle Guo and Chongyi Li and Ming-Ming Cheng},
journal= {arXiv preprint arXiv:2602.02393},
year = {2026}
}
备注
project page: https://rq-wu.github.io/projects/infinite-world/index.html