iDesigner:面向室内设计的高分辨率与复杂提示跟随文本到图像扩散模型
计算机视觉与模式识别
2023-12-20 v2
摘要
随着稳定扩散(SD)和稳定扩散XL(SD-XL)等文本到图像模型(T2I)的开源,基于开源SD模型在特定领域(如动漫、人物肖像等)微调的模型大量涌现。然而,在某些领域(如室内设计)中,专业模型却很少,这归因于设计中固有的复杂文本描述和详细视觉元素,以及分辨率可适应的必要性。因此,用于室内设计的文本到图像模型需要具备出色的提示跟随能力,并与设计专业人员迭代协作以达到预期效果。本文收集并优化了设计领域的文本-图像数据,并在开源CLIP模型的基础上继续使用中英文进行训练。我们还提出了一种结合课程学习和基于CLIP反馈的强化学习的微调策略,以增强我们方法的提示跟随能力,从而提高图像生成质量。在收集的数据集上的实验结果表明了所提方法的有效性,该方法取得了令人印象深刻的结果,并优于强基线。
引用
@article{arxiv.2312.04326,
title = {iDesigner: A High-Resolution and Complex-Prompt Following Text-to-Image Diffusion Model for Interior Design},
author = {Ruyi Gan and Xiaojun Wu and Junyu Lu and Yuanhe Tian and Dixiang Zhang and Ziwei Wu and Renliang Sun and Chang Liu and Jiaxing Zhang and Pingjian Zhang and Yan Song},
journal= {arXiv preprint arXiv:2312.04326},
year = {2023}
}