面向GAN潜空间的可视概念词汇构建
计算机视觉与模式识别
2021-10-11 v1 人工智能
摘要
近期大量工作已在生成对抗网络(GANs)的潜空间中识别出能够一致且可解释地转换生成图像的变换。但现有识别这些变换的技术要么依赖于预指定可视概念的固定词汇,要么依赖于无监督解耦技术,而其与人类关于感知显著性的判断的一致性未知。本文引入一种新方法,用于构建GAN潜空间中所表示的原语可视概念的开放式词汇。我们的方法由三部分构成:(1)基于层选择性自动识别感知显著方向;(2)使用自由形式、组合式自然语言描述对这些方向进行人工标注;(3)将这些标注分解为可视概念词汇,由标有单词的提炼方向组成。实验表明,用我们方法学到的概念可靠且可组合——跨类别、上下文和观察者泛化,并支持对图像风格与内容的细粒度操控。
引用
@article{arxiv.2110.04292,
title = {Toward a Visual Concept Vocabulary for GAN Latent Space},
author = {Sarah Schwettmann and Evan Hernandez and David Bau and Samuel Klein and Jacob Andreas and Antonio Torralba},
journal= {arXiv preprint arXiv:2110.04292},
year = {2021}
}
备注
15 pages, 13 figures. Accepted to ICCV 2021. Project page: https://visualvocab.csail.mit.edu