中文

WISA: 物理感知的世界模拟器辅助文本到视频生成

计算机视觉与模式识别 2025-03-12 v1

摘要

近期文本到视频(T2V)生成的快速发展,如 SoRA 和 Kling,展示了构建世界模拟器的巨大潜力。然而,当前的 T2V 模型难以理解抽象物理原理并生成遵循物理定律的视频。这一挑战主要源于抽象物理原理与生成模型之间存在显著差距,导致缺乏对物理信息的明确指导。为此,我们提出了世界模拟器辅助(WISA),一个将物理原理分解并融入 T2V 模型的有效框架。具体而言,WISA 将物理原理分解为文本物理描述、定性物理类别和定量物理属性。为了将这些物理属性有效嵌入生成过程,WISA 包含了若干关键设计,包括物理专家混合注意力(MoPA)和物理分类器,从而增强模型的物理感知能力。此外,大多数现有数据集中的视频要么弱化了物理现象,要么将其与多个共现过程纠缠在一起,限制了其作为学习显式物理原理的专用资源的适用性。我们提出了一种新颖的视频数据集 WISA-32K,基于定性物理类别收集。该数据集包含 32,000 个视频,代表了物理学三个领域——动力学、热力学和光学——中的 17 条物理定律。实验结果表明,WISA 能够有效增强 T2V 模型与真实物理定律的兼容性,在 VideoPhy 基准测试上取得了显著提升。WISA 和 WISA-32K 的可视化展示可在 https://360cvgroup.github.io/WISA/ 获取。

关键词

引用

@article{arxiv.2503.08153,
  title  = {WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation},
  author = {Jing Wang and Ao Ma and Ke Cao and Jun Zheng and Zhanjie Zhang and Jiasong Feng and Shanyuan Liu and Yuhang Ma and Bo Cheng and Dawei Leng and Yuhui Yin and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2503.08153},
  year   = {2025}
}