为复杂场景生成建模图像组合
计算机视觉与模式识别
2022-06-03 v1
摘要
我们提出一种方法,通过准确建模复杂场景中包含的纹理、结构与关系,在具有挑战性的(少样本)布局到图像生成任务上取得 SOTA 结果。在将 RGB 图像压缩为块令牌后,我们提出带聚焦注意力(Focal Attention)的 Transformer(TwFA)来探索物体到物体、物体到块以及块到块的依赖关系。相较于现有分别在像素级与块级、物体级与块级上纠缠建模的基于 CNN 与基于 Transformer 的生成模型,所提聚焦注意力仅通过关注由空间布局指定的高度相关令牌来预测当前块令牌,从而在训练中实现消歧。此外,所提 TwFA 大幅提升了训练时的数据效率,因此我们基于训练良好的 TwFA 提出了首个少样本复杂场景生成策略。综合实验显示了我们方法的优越性,相较于 SOTA 的基于 CNN 与基于 transformer 的方法,其在定量指标与定性视觉真实感上均显著提升。代码见 https://github.com/JohnDreamer/TwFA。
引用
@article{arxiv.2206.00923,
title = {Modeling Image Composition for Complex Scene Generation},
author = {Zuopeng Yang and Daqing Liu and Chaoyue Wang and Jie Yang and Dacheng Tao},
journal= {arXiv preprint arXiv:2206.00923},
year = {2022}
}
备注
CVPR 2022