中文

面向GAN潜空间的可视概念词汇构建

计算机视觉与模式识别 2021-10-11 v1 人工智能

摘要

近期大量工作已在生成对抗网络(GANs)的潜空间中识别出能够一致且可解释地转换生成图像的变换。但现有识别这些变换的技术要么依赖于预指定可视概念的固定词汇,要么依赖于无监督解耦技术,而其与人类关于感知显著性的判断的一致性未知。本文引入一种新方法,用于构建GAN潜空间中所表示的原语可视概念的开放式词汇。我们的方法由三部分构成:(1)基于层选择性自动识别感知显著方向;(2)使用自由形式、组合式自然语言描述对这些方向进行人工标注;(3)将这些标注分解为可视概念词汇,由标有单词的提炼方向组成。实验表明,用我们方法学到的概念可靠且可组合——跨类别、上下文和观察者泛化,并支持对图像风格与内容的细粒度操控。

关键词

引用

@article{arxiv.2110.04292,
  title  = {Toward a Visual Concept Vocabulary for GAN Latent Space},
  author = {Sarah Schwettmann and Evan Hernandez and David Bau and Samuel Klein and Jacob Andreas and Antonio Torralba},
  journal= {arXiv preprint arXiv:2110.04292},
  year   = {2021}
}

备注

15 pages, 13 figures. Accepted to ICCV 2021. Project page: https://visualvocab.csail.mit.edu