中文

基于可变形卷积与注意力机制的跨视角图像合成

计算机视觉与模式识别 2020-07-21 v1

摘要

学习生成自然场景一直是计算机视觉中一项艰巨的任务。当生成具有差异极大的视角的图像时,这一任务更加费力。当视角差异很大时,视场重叠很少或物体被遮挡,导致该任务极具挑战性。在本文中,我们提出使用基于可变形卷积与注意力机制的生成对抗网络(GAN)来解决跨视角图像合成问题(见图1)。从另一视角理解和转换场景外观与语义信息十分困难,因此我们在 U-net 网络中使用可变形卷积以提升网络在不同尺度下提取物体特征的能力。此外,为了更好地学习不同视角图像之间的对应关系,我们应用注意力机制来细化中间特征图,从而生成更逼真的图像。在 Dayton 数据集[1]上针对不同尺寸图像的大量实验表明,我们的模型能够比当前最优(state-of-the-art)方法产生更好的结果。

关键词

引用

@article{arxiv.2007.09858,
  title  = {Cross-View Image Synthesis with Deformable Convolution and Attention Mechanism},
  author = {Hao Ding and Songsong Wu and Hao Tang and Fei Wu and Guangwei Gao and Xiao-Yuan Jing},
  journal= {arXiv preprint arXiv:2007.09858},
  year   = {2020}
}