中文

结合语义引导与深度强化学习生成人类水平绘画

计算机视觉与模式识别 2021-06-16 v2 计算几何 机器学习

摘要

基于笔触的非真实感图像生成是计算机视觉领域的一个重要问题。作为该方向的一种努力,近期大量研究集中于以类似人类画家的方式教机器“如何绘画”。然而,以往方法的适用性局限于前景物体在位置、尺度和显著性上变化很小的数据集。因此,我们发现这些方法难以覆盖真实世界图像所具备的精细度与多样性。为此,我们提出了一种语义引导流程,包含:1)在训练时采用双层绘画过程以学习前景与背景笔触之间的区别;2)我们还通过神经对齐模型引入对前景物体位置和尺度的不变性,该模型以端到端方式结合目标定位与空间变换网络,以放大某一特定语义实例;3)随后通过最大化一种基于引导反向传播的新颖聚焦奖励,增强聚焦物体的区分性特征。所提出的智能体不需要任何人笔触数据的监督,并成功处理了前景物体属性的变化,从而在 CUB-200 Birds 和 Stanford Cars-196 数据集上生成了更高质量的画布。最后,我们通过在具有多个前景物体实例的复杂数据集 Virtual-KITTI 上评估本方法的扩展,进一步证明了方法的有效性。源代码与模型见 https://github.com/1jsingh/semantic-guidance。

关键词

引用

@article{arxiv.2011.12589,
  title  = {Combining Semantic Guidance and Deep Reinforcement Learning For Generating Human Level Paintings},
  author = {Jaskirat Singh and Liang Zheng},
  journal= {arXiv preprint arXiv:2011.12589},
  year   = {2021}
}