中文

Transframer:基于生成模型的任意帧预测

计算机视觉与模式识别 2022-05-10 v3 机器学习

摘要

我们提出一种基于概率帧预测的通用图像建模与视觉任务框架。我们的方法统一了广泛任务,从图像分割、新视角合成到视频插帧。我们将此框架与一种称为 Transframer 的架构配对,其使用 U-Net 与 Transformer 组件以标注上下文帧为条件,并输出稀疏压缩图像特征序列。Transframer 在多种视频生成基准上为 SOTA,在少样本视角合成上与最强模型相当,且能在无任何显式几何信息下从单幅图像生成连贯的 30 秒视频。单一通用 Transframer 同时在 8 项任务上产生有前景的结果,包括语义分割、图像分类与光流预测,且无任务专用架构组件,表明多任务计算机视觉可使用概率图像模型处理。我们的方法原则上可应用于需要学习标注图像格式数据条件结构的广泛应用。

关键词

引用

@article{arxiv.2203.09494,
  title  = {Transframer: Arbitrary Frame Prediction with Generative Models},
  author = {Charlie Nash and João Carreira and Jacob Walker and Iain Barr and Andrew Jaegle and Mateusz Malinowski and Peter Battaglia},
  journal= {arXiv preprint arXiv:2203.09494},
  year   = {2022}
}