视频基础模型编码多少 3D 信息?
计算机视觉与模式识别
2025-12-24 v1 人工智能
摘要
视频是 3D 世界的连续 2D 投影。训练大量视频数据后,global 3D 理解是否自然涌现?我们通过量化现有 Video Foundation Models(VidFMs)在大视频数据上的 3D 理解来研究这一问题。我们提出了第一套能够通过浅层 read-out 估计各种 VidFMs 3D 感知的 model-agnostic 框架,以衡量其 3D 意识。我们的研究在多个轴向呈现了有意义的发现关于 VidFMs 的 3D 意识。在 particular,我们表明,state-of-the-art 视频生成模型表现出强烈的 3D 对象和场景理解,尽管它们未在任何 3D 数据上训练。这种理解甚至可以超过专门用于 3D 任务训练的大型 expert 模型。我们的结果以及对主要 VidFMs 的 3D 基准测试,为构建可扩展的 3D 模型提供了宝贵的观察。
引用
@article{arxiv.2512.19949,
title = {How Much 3D Do Video Foundation Models Encode?},
author = {Zixuan Huang and Xiang Li and Zhaoyang Lv and James M. Rehg},
journal= {arXiv preprint arXiv:2512.19949},
year = {2025}
}
备注
Project Page: https://vidfm-3d-probe.github.io