中文

基于扩散模型的多战略自监督视频帧插值

计算机视觉与模式识别 2025-11-11 v1 人工智能

摘要

视频帧插值(VFI)仍是视频增强的基石,使能够实现缓慢-motion 渲染、帧率转换和视频修复等任务的时序提升。虽然经典方法依赖光流且基于学习的方法假设获得密集的真实帧,但两者都在遮挡、领域迁移和模糊运动方面存在挑战。本文介绍 MiVID,这是一个轻量级、自监督的、基于扩散模型的视频插值框架。我们的模型通过结合 3D U-Net 主干网络和 transformer 风格的时序注意力机制,训练于混合掩码方案下,以模拟遮挡和运动不确定性。采用基于余弦的渐进掩码和自适应损失调度,使网络能够在无需任何高帧率监督的情况下学习鲁棒的时空表示。我们的框架在 UCF101-7 和 DAVIS-7 数据集上进行评估。MiVID 在数据集和 9 帧视频片段上完全使用 CPU 训练,使其成为低资源且高效的管道。尽管存在这些限制,我们的模型仅需 50 个 epoch 即可达到最佳结果,与数个监督基线方法相竞争。这一工作展示了自监督扩散先验在具有时序一致性的帧合成方面的潜力,并为实现可及且通用的 VFI 系统提供了可扩展的路径。

关键词

引用

@article{arxiv.2511.06019,
  title  = {MiVID: Multi-Strategic Self-Supervision for Video Frame Interpolation using Diffusion Model},
  author = {Priyansh Srivastava and Romit Chatterjee and Abir Sen and Aradhana Behura and Ratnakar Dash},
  journal= {arXiv preprint arXiv:2511.06019},
  year   = {2025}
}