重新思考丰富上下文布局到图像生成的训练与评估
计算机视觉与模式识别
2025-01-14 v2
摘要
生成模型的最新进展显著增强了其图像生成能力,实现了图像编辑、补全和视频编辑等广泛应用。生成建模中的一个专门领域是布局到图像 (L2I) 生成,其中预定义的物体布局指导生成过程。在这项研究中,我们引入了一种新颖的区域交叉注意力模块,专门用于丰富布局到图像生成。该模块显著改善了布局区域的表示,特别是在现有方法难以处理高度复杂和详细文本描述的场景中。此外,虽然当前的开集 L2I 方法是在开集设置下训练的,但它们的评估通常发生在闭集环境中。为了弥合这一差距,我们提出了两个指标来评估开集场景下的 L2I 性能。此外,我们进行了一项全面的用户研究,以验证这些指标与人类偏好的一致性。
引用
@article{arxiv.2409.04847,
title = {Rethinking The Training And Evaluation of Rich-Context Layout-to-Image Generation},
author = {Jiaxin Cheng and Zixu Zhao and Tong He and Tianjun Xiao and Yicong Zhou and Zheng Zhang},
journal= {arXiv preprint arXiv:2409.04847},
year = {2025}
}
备注
Accepted in NeurIPS 2024