SketchFlex:通过基于区域的草图促进文本到图像生成中的空间语义一致性
人机交互
2025-02-12 v1 计算机视觉与模式识别
摘要
文本到图像模型能够从文本描述生成视觉吸引人的图像。致力于改进模型控制的努力包括 prompt tuning 和空间条件化。然而,我们的形式化研究突显了在精心制作合适的提示并指定细粒度空间条件(如深度或 canny 参考)以生成语义上一致的图像方面的挑战,尤其是在涉及多个对象的情形下。为此,我们引入 SketchFlex,一个旨在改善使用粗略区域草图进行空间条件化图像生成灵活性的交互式系统。系统自动推断用户提示,生成在由众所周知的对象属性和关系丰富的语义空间中进行理性描述的提示。此外,SketchFlex 将用户的粗略草图细化为 canny 基于形状锚点,确保生成质量和用户意图的对齐。实验结果表明,SketchFlex 在实现更具一致性的图像生成方面优于端到端模型,同时在降低认知负荷和更好匹配用户意图方面显著优于基于区域的生成基线。
引用
@article{arxiv.2502.07556,
title = {SketchFlex: Facilitating Spatial-Semantic Coherence in Text-to-Image Generation with Region-Based Sketches},
author = {Haichuan Lin and Yilin Ye and Jiazhi Xia and Wei Zeng},
journal= {arXiv preprint arXiv:2502.07556},
year = {2025}
}
备注
conference: CHI2025