图像局部自回归 Transformer
计算机视觉与模式识别
2021-10-19 v2 图像与视频处理
摘要
近年来,由 Transformer 赋能的整图自回归(AR)生成模型已取得与生成对抗网络(GANs)相当甚至更优的性能。遗憾的是,直接将此类 AR 模型应用于编辑/更改局部图像区域时,可能面临全局信息缺失、推理速度慢以及局部引导信息泄漏等问题。为克服这些局限,我们提出一种新颖模型——图像局部自回归 Transformer(iLAT),以更好地促进局部引导的图像合成。我们的 iLAT 通过新提出的结合注意力掩码与卷积机制的局部自回归(LA)Transformer 学习新颖的局部离散表示。因此,iLAT 能够通过关键引导信息高效地合成局部图像区域。我们的 iLAT 在多种局部引导图像合成任务上进行了评估,例如姿态引导的人体图像合成与人脸编辑。定量与定性结果均显示了我们模型的有效性。
引用
@article{arxiv.2106.02514,
title = {The Image Local Autoregressive Transformer},
author = {Chenjie Cao and Yuxin Hong and Xiang Li and Chengrong Wang and Chengming Xu and XiangYang Xue and Yanwei Fu},
journal= {arXiv preprint arXiv:2106.02514},
year = {2021}
}
备注
Accepted by NeurIPS2021