中文

世界模型能否使 VLM 受益于世界动态理解?

计算机视觉与模式识别 2025-10-02 v1 人工智能 计算与语言 机器学习

摘要

在互联网规模视频数据上训练的生成式世界模型,正日益被视为能够生成关于结构、运动和物理的一致且合理动态的强大世界模拟器。这引发了一个自然问题:随着强大的视频基础模型的出现,它们是否会取代用于通用多模态理解的传统视觉编码器范式?尽管近期研究已开始探索世界模型在常见视觉任务上的潜力,但这些探索通常缺乏对通用多模态任务的系统性研究。在本工作中,我们致力于研究将世界模型先验迁移到 Vision-Language Models 中的能力:我们将视频扩散模型重用为生成式编码器以执行单步去噪,并将所得隐变量视为一组视觉嵌入。我们从经验上研究了这类模型,我们将其称为 World-Language Models (WorldLMs),并发现生成式编码器能够捕获对下游理解有用的隐变量,且这些隐变量与传统编码器表现出区别。我们将表现最佳的变体命名为 Dynamic Vision Aligner (DyVA),我们进一步发现该方法显著增强了空间推理能力,并使单图模型能够执行多帧推理。通过整理一套视觉推理任务,我们发现 DyVA 超越了开源和专有基线,取得了 SOTA 或可比的性能。我们将这些增益归因于 WorldLM 从视频预训练中继承的运动一致性内化。最后,我们系统地探索了广泛的模型设计,以突出未来工作有前景的方向。我们希望我们的研究能为利用世界模型先验的 VLM 新家族铺平道路,并迈向通用视觉学习者的光明道路。

关键词

引用

@article{arxiv.2510.00855,
  title  = {Can World Models Benefit VLMs for World Dynamics?},
  author = {Kevin Zhang and Kuangzhi Ge and Xiaowei Chi and Renrui Zhang and Shaojun Shi and Zhen Dong and Sirui Han and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2510.00855},
  year   = {2025}
}

备注

Project page: https://dyva-worldlm.github.io