中文

在视频数据集上拟合图像扩散模型

计算机视觉与模式识别 2025-09-05 v1

摘要

图像扩散模型是在独立抽样的静态图像上进行训练的。虽然这是生成模型中的基础任务协议,但通过静态快照的镜头捕捉时序世界存在信息不足的局限。这一限制导致收敛速度慢、分布覆盖范围有限且泛化性下降。本文提出一种简单有效的训练策略,利用连续视频帧中存在的时序归纳偏置来改进扩散训练。显著的是,所提方法无需架构修改,可无缝集成到标准扩散训练管道中。我们在HandCo数据集上进行评估,该数据集中手部-物体交互具有密集的时序一致性,手指关节细微变化常导致语义上不同的运动。实验结果表明,我们的方法比2倍以上加快收敛速度,并在训练和验证分布上实现更低的FID。它还通过鼓励模型捕捉有意义的时序变化来提高生成多样性。我们进一步提供了优化分析,表明该正则化减少了梯度方差,从而有助于更快的收敛。

关键词

引用

@article{arxiv.2509.03794,
  title  = {Fitting Image Diffusion Models on Video Datasets},
  author = {Juhun Lee and Simon S. Woo},
  journal= {arXiv preprint arXiv:2509.03794},
  year   = {2025}
}

备注

ICCV25 Workshop