中文

MMPhysVideo: 通过联合多模态建模扩展视频生成中的物理合理性

计算机视觉与模式识别 2026-04-06 v1

摘要

尽管生成视觉上令人惊叹的内容取得了进展,视频扩散模型(VDMs)由于仅基于像素重建,常产生物理不一致的结果。为解决这一问题,本文提出MMPhysVideo,这是首个通过联合多模态建模扩展视频生成中物理合理性的框架。我们将感知线索,特别是语义、几何和时空轨迹,重构为统一的伪RGB格式,使VDMs能够直接捕捉复杂的物理动力学。为缓解跨模态干扰,本文提出Bidirectionally Controlled Teacher架构,该架构利用并行分支完全解耦RGB和感知处理,并采用两个零初始化控制链接逐步学习像素级一致性。为推理效率,教师的物理先验通过表征对齐蒸馏为单流学生模型。此外,本文提出MMPhysPipe,一个可扩展的数据构建和标注流水线,专门用于构建物理丰富的多模态数据集。MMPhysPipe采用由视觉证据链规则引导的视觉语言模型(VLM)来定位物理主体,使专家模型能够提取多粒度感知信息。无需额外推理成本,MMPhysVideo在各种基准测试中持续提升物理合理性和视觉质量,并在与现有方法的比较中达到最先进的性能。

关键词

引用

@article{arxiv.2604.02817,
  title  = {MMPhysVideo: Scaling Physical Plausibility in Video Generation via Joint Multimodal Modeling},
  author = {Shubo Lin and Xuanyang Zhang and Wei Cheng and Weiming Hu and Gang Yu and Jin Gao},
  journal= {arXiv preprint arXiv:2604.02817},
  year   = {2026}
}

备注

Project Page: https://shubolin028.github.io/MMPhysVideo-Page