中文

统一任意时刻视频帧插值与预测

计算机视觉与模式识别 2025-03-05 v1

摘要

视频帧插值与预测分别旨在合成现有帧之间及之后的帧。尽管两者密切相关,但传统上使用不同的模型架构,或相同架构但独立训练的权重来研究这两个任务。此外,虽然任意时刻插值已被广泛研究,但任意时刻预测的价值在很大程度上被忽略了。在本工作中,我们提出了 uniVIP——统一的任意时刻视频插值与预测。在技术上,我们首先扩展了仅用于插值的网络以实现任意时刻插值与预测,并使用特殊的输入通道进行任务(插值或预测)编码。然后,我们展示了如何在常见的三元组帧上训练统一模型。我们的 uniVIP 在视频插值方面取得了有竞争力的结果,并在视频预测方面优于现有的 SOTA。代码将发布于:https://github.com/srcn-ivl/uniVIP

关键词

引用

@article{arxiv.2503.02316,
  title  = {Unified Arbitrary-Time Video Frame Interpolation and Prediction},
  author = {Xin Jin and Longhai Wu and Jie Chen and Ilhyun Cho and Cheul-Hee Hahm},
  journal= {arXiv preprint arXiv:2503.02316},
  year   = {2025}
}

备注

Accepted by ICASSP 2025