中文

INR-V:面向视频生成任务的连续表示空间

计算机视觉与模式识别 2023-04-04 v2

摘要

生成视频是一项复杂任务,通常通过逐帧生成一组时间上连贯的图像来完成。这将视频的表达能力限制为仅能对单个视频帧进行基于图像的操作,需要专门设计网络以在底层图像空间中获得时间上连贯的轨迹。我们提出 INR-V,一种为视频生成任务学习连续空间的视频表示网络。INR-V 使用隐式神经表示(INRs)——一种为视频每个输入像素位置预测 RGB 值的多层感知机——对视频进行参数化。该 INR 由一个元网络预测,元网络是在多个视频实例的神经表示上训练得到的超网络(hypernetwork)。之后,可对元网络进行采样以生成多样的新视频,从而支持许多下游视频生成任务。有趣的是,我们发现条件正则化与渐进式权重初始化在获得 INR-V 中起着关键作用。INR-V 学习到的表示空间比图像空间更具表达力,展现出已有工作无法实现的许多有趣性质。例如,INR-V 可在已知视频实例之间平滑插值中间视频(如人脸视频中的中间身份、表情与姿态)。它还能对视频中缺失部分进行修复以恢复时间连贯的完整视频。本文中,我们在视频插值、新视频生成、视频反演与视频修复等多种生成任务上,针对已有基线评估了 INR-V 学习到的空间。INR-V 在多项所示任务上显著优于基线,清晰展示了所提表示空间的潜力。

关键词

引用

@article{arxiv.2210.16579,
  title  = {INR-V: A Continuous Representation Space for Video-based Generative Tasks},
  author = {Bipasha Sen and Aditya Agarwal and Vinay P Namboodiri and C. V. Jawahar},
  journal= {arXiv preprint arXiv:2210.16579},
  year   = {2023}
}

备注

Published in Transactions on Machine Learning Research (10/2022); https://openreview.net/forum?id=aIoEkwc2oB