中文

AI生成视频距离模拟3D视觉世界有多远:一种基于学习的3D评估方法

计算机视觉与模式识别 2025-10-07 v2 人工智能

摘要

视频扩散模型的最新进展使得生成具有出色3D一致性和时间连贯性的逼真视频成为可能。然而,这些AI生成视频在多大程度上模拟了3D视觉世界仍未被充分探索。在本文中,我们引入了学习型3D评估(L3DE),这是一种客观、可量化且可解释的方法,用于在不需要人工标注缺陷或质量标注的情况下,评估AI生成视频在3D视觉质量和一致性方面模拟真实世界的能力。L3DE不依赖于在野外视频中容易失败的3D重建,而是采用在运动、深度和外观的单目3D线索上训练的3D卷积网络来区分真实视频与合成视频。L3DE的置信度得分量化了真实视频与合成视频在3D视觉连贯性方面的差距,而基于梯度的可视化精确定位了不真实的区域,从而提高了可解释性。我们通过广泛的实验验证了L3DE,证明了其与3D重建质量和人类判断的强一致性。我们对领先的生成模型(如Kling、Sora和MiniMax)的评估揭示了持续存在的模拟差距和细微的不一致性。除了生成视频评估之外,L3DE还扩展到更广泛的应用:对视频生成模型进行基准测试,用作deepfake检测器,以及通过修复被标记的不一致性来增强视频合成。项目页面:https://justin-crchang.github.io/l3de-project-page/

关键词

引用

@article{arxiv.2406.19568,
  title  = {How Far are AI-generated Videos from Simulating the 3D Visual World: A Learned 3D Evaluation Approach},
  author = {Chirui Chang and Jiahui Liu and Zhengzhe Liu and Xiaoyang Lyu and Yi-Hua Huang and Xin Tao and Pengfei Wan and Di Zhang and Xiaojuan Qi},
  journal= {arXiv preprint arXiv:2406.19568},
  year   = {2025}
}

备注

ICCV 2025