中文

Seer:基于隐扩散模型的语言指令视频预测

计算机视觉与模式识别 2026-04-28 v4

摘要

想象未来轨迹是机器人做出合理规划并成功达成目标的关键。因此,文本条件视频预测 (TVP) 是促进通用机器人策略学习的一项基本任务。为应对该任务并赋予机器人预见未来的能力,我们提出了一种样本与计算高效的模型,名为 \textbf{Seer},通过沿时间轴扩充预训练的文本到图像 (T2I) 稳定扩散模型得到。我们通过引入计算高效的空间-时间注意力增强了 U-Net 与语言条件模型。此外,我们提出了一种新颖的帧序列文本分解器模块,将句子的全局指令拆解为时间对齐的子指令,确保精确融入生成的每一帧。我们的框架使我们能有效利用预训练 T2I 模型中跨帧嵌入的广泛先验知识。借助适配设计的架构,Seer 通过对少量数据上少数层进行微调,即可生成高保真、连贯且与指令对齐的视频帧。在 Something Something V2 (SSv2)、Bridgedata 和 EpicKitchens-100 数据集上的实验结果表明,我们以约 480 GPU 小时对比 CogVideo 的超过 12,480 GPU 小时取得了优越的视频预测性能:在 SSv2 上相较当前 SOTA 模型实现 31% 的 FVD 提升,并在人类评估中获得 83.7% 的平均偏好率。

关键词

引用

@article{arxiv.2303.14897,
  title  = {Seer: Language Instructed Video Prediction with Latent Diffusion Models},
  author = {Xianfan Gu and Chuan Wen and Weirui Ye and Jiaming Song and Yang Gao},
  journal= {arXiv preprint arXiv:2303.14897},
  year   = {2026}
}

备注

31 pages, 24 figures