结合语义引导与深度强化学习生成人类水平绘画
计算机视觉与模式识别
2021-06-16 v2 计算几何
机器学习
摘要
基于笔触的非真实感图像生成是计算机视觉领域的一个重要问题。作为该方向的一种努力,近期大量研究集中于以类似人类画家的方式教机器“如何绘画”。然而,以往方法的适用性局限于前景物体在位置、尺度和显著性上变化很小的数据集。因此,我们发现这些方法难以覆盖真实世界图像所具备的精细度与多样性。为此,我们提出了一种语义引导流程,包含:1)在训练时采用双层绘画过程以学习前景与背景笔触之间的区别;2)我们还通过神经对齐模型引入对前景物体位置和尺度的不变性,该模型以端到端方式结合目标定位与空间变换网络,以放大某一特定语义实例;3)随后通过最大化一种基于引导反向传播的新颖聚焦奖励,增强聚焦物体的区分性特征。所提出的智能体不需要任何人笔触数据的监督,并成功处理了前景物体属性的变化,从而在 CUB-200 Birds 和 Stanford Cars-196 数据集上生成了更高质量的画布。最后,我们通过在具有多个前景物体实例的复杂数据集 Virtual-KITTI 上评估本方法的扩展,进一步证明了方法的有效性。源代码与模型见 https://github.com/1jsingh/semantic-guidance。
引用
@article{arxiv.2011.12589,
title = {Combining Semantic Guidance and Deep Reinforcement Learning For Generating Human Level Paintings},
author = {Jaskirat Singh and Liang Zheng},
journal= {arXiv preprint arXiv:2011.12589},
year = {2021}
}