统一任意时刻视频帧插值与预测
计算机视觉与模式识别
2025-03-05 v1
摘要
视频帧插值与预测分别旨在合成现有帧之间及之后的帧。尽管两者密切相关,但传统上使用不同的模型架构,或相同架构但独立训练的权重来研究这两个任务。此外,虽然任意时刻插值已被广泛研究,但任意时刻预测的价值在很大程度上被忽略了。在本工作中,我们提出了 uniVIP——统一的任意时刻视频插值与预测。在技术上,我们首先扩展了仅用于插值的网络以实现任意时刻插值与预测,并使用特殊的输入通道进行任务(插值或预测)编码。然后,我们展示了如何在常见的三元组帧上训练统一模型。我们的 uniVIP 在视频插值方面取得了有竞争力的结果,并在视频预测方面优于现有的 SOTA。代码将发布于:https://github.com/srcn-ivl/uniVIP
引用
@article{arxiv.2503.02316,
title = {Unified Arbitrary-Time Video Frame Interpolation and Prediction},
author = {Xin Jin and Longhai Wu and Jie Chen and Ilhyun Cho and Cheul-Hee Hahm},
journal= {arXiv preprint arXiv:2503.02316},
year = {2025}
}
备注
Accepted by ICASSP 2025