中文

从单幅图像与视频生成新颖场景组合

计算机视觉与模式识别 2023-12-14 v5 机器学习

摘要

给定大规模训练数据集,生成对抗网络(GANs)可在图像合成任务上取得卓越性能。然而,在极低数据量情形下训练 GAN 仍具挑战,常发生过拟合,导致记忆或训练发散。本工作中,我们引入 SIV-GAN,一种可从单幅训练图像或单个视频片段生成新场景组合的无条件生成模型。我们提出双分支判别器架构,包含内容与布局分支,分别用于独立判断内部内容与场景布局的真实感。该判别器设计使得在保留原始样本语境的同时,可合成具有变化内容与布局、视觉合理的场景新组合。相较先前单图像 GAN,我们的模型生成更多样、更高质量的图像,且不受限于单图像设定。我们进一步引入从单视频少量帧学习这一新挑战性任务。在此训练设定下,训练图像彼此高度相似,使得已有 GAN 模型难以同时实现高质量与多样性的合成。

关键词

引用

@article{arxiv.2103.13389,
  title  = {Generating Novel Scene Compositions from Single Images and Videos},
  author = {Vadim Sushko and Dan Zhang and Juergen Gall and Anna Khoreva},
  journal= {arXiv preprint arXiv:2103.13389},
  year   = {2023}
}

备注

Accepted for publication in Computer Vision and Image Understanding: https://www.sciencedirect.com/science/article/pii/S1077314223002680. Code repository: https://github.com/boschresearch/one-shot-synthesis