Olaf-World:面向视频世界建模的潜在动作方向化
计算机视觉与模式识别
2026-05-27 v2 人工智能
机器学习
摘要
规模化的可控世界模型受到动作标签稀缺的限制。虽然潜在动作学习承诺能从无标签视频中提取控制界面,但学习得到的潜在表示往往难以在不同情境之间迁移:它们 entangled( entangled)场景特定线索且缺乏统一的坐标系。这是因为标准目标仅在每个片段内 operate,无法在情境之间对动作语义进行对齐。我们的关键洞察是:虽然动作是不可观测的,但它们的语义效应是可观测的,可作为共享参考。我们引入 Seq-REPA,一种基于序列级控制效应对齐的目标函数,通过锚定集成化潜在动作于冻结的自监督视频编码器的时序特征差异。基于此,我们提出 Olaf-World 框架,从大规模被动视频预训练动作条件化视频世界模型。大量实验表明,我们的方法学习出更结构化的潜在动作空间,实现更强的零样本动作迁移和更高的数据效率适应新控制界面。
引用
@article{arxiv.2602.10104,
title = {Olaf-World: Orienting Latent Actions for Video World Modeling},
author = {Yuxin Jiang and Yuchao Gu and Ivor W. Tsang and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2602.10104},
year = {2026}
}
备注
ICML 2026. Project page: https://showlab.github.io/Olaf-World/ Code: https://github.com/showlab/Olaf-World