基于双重强化的图像去渲染规范生成
计算与语言
2021-03-03 v1 人工智能
计算机视觉与模式识别
摘要
深度学习的进展使得通过去渲染计算机生成图像来推断图形程序取得了可喜进展。然而,当前方法并未探讨何种解码方法能为推断图形程序带来更好的归纳偏置。在我们的工作中,我们首先探讨了 LSTM-RNN 与 Transformer 网络作为无序关依赖图形程序解码器的有效性。由于这些是序列模型,我们必须为似然训练选择图形程序中对象的排序。我们发现 LSTM 的性能对序列排序(随机顺序 vs. 基于模式的顺序)高度敏感,而 Transformer 的性能大致与序列排序无关。进一步,我们提出了一种基于策略梯度的强化学习方法,通过基于图形程序规范与渲染图像的多重多样奖励为解码器带来更好的归纳偏置。我们还探讨了这些互补奖励的组合。我们在两个图形程序生成数据集上取得了最先进的结果。
引用
@article{arxiv.2103.01867,
title = {Dual Reinforcement-Based Specification Generation for Image De-Rendering},
author = {Ramakanth Pasunuru and David Rosenberg and Gideon Mann and Mohit Bansal},
journal= {arXiv preprint arXiv:2103.01867},
year = {2021}
}
备注
AAAI 2021 Scientific Document Understanding Workshop (9 pages)