中文

潜在知识引导的视频扩散模型:从单帧初始帧生成科学现象

计算机视觉与模式识别 2025-11-14 v2 应用统计

摘要

视频扩散模型在自然场景生成中取得了令人瞩目的成果,然而它们难以泛化到流体模拟和气象过程等科学现象,这些现象的基础动力学受科学定律支配。这些任务带来了独特的挑战,包括严重的领域差距、有限的训练数据以及缺乏描述性语言标注。为解决这一困境,我们提取了潜在的科学现象知识,并进一步提出了一个新颖的框架,教导视频扩散模型从单帧初始帧生成科学现象。具体而言,静态知识通过预训练的掩码自编码器提取,而动态知识则从预训练的光流预测中导出。随后,基于 CLIP 视觉和语言编码器之间对齐的空间关系,科学现象的视觉嵌入在潜在科学现象知识的引导下,被投影以在空间域和频率域中生成伪语言提示嵌入。通过整合这些提示并微调视频扩散模型,我们能够生成更符合科学定律的视频。在计算流体力学模拟和真实世界台风观测上的大量实验证明了我们方法的有效性,在多种科学场景中均实现了卓越的保真度和一致性。

关键词

引用

@article{arxiv.2411.11343,
  title  = {Latent Knowledge-Guided Video Diffusion for Scientific Phenomena Generation from a Single Initial Frame},
  author = {Qinglong Cao and Xirui Li and Ding Wang and Chao Ma and Yuntian Chen and Xiaokang Yang},
  journal= {arXiv preprint arXiv:2411.11343},
  year   = {2025}
}