利用结构化信息改善文本到图像生成中的空间关系
人工智能
2025-09-22 v1
摘要
文本到图像 (T2I) 生成技术发展迅速,然而忠实捕捉自然语言提示中描述的空间关系仍然是一个重大挑战。先前的工作通过提示优化、空间基础生成和语义细化来解决这一问题。本工作引入了一种轻量级方法,利用基于元组的结构化信息增强提示,使用微调的语言模型进行自动转换并无缝集成到 T2I 流水线中。实验结果表明,空间准确性得到了显著改善,同时未损害由 Inception Score 衡量的整体图像质量。此外,自动生成的元组展现出与人工制作元组相当的质量。这种结构化信息提供了一种实用且可移植的解决方案,以增强 T2I 生成中的空间关系,解决了当前大规模生成系统的关键局限性。
引用
@article{arxiv.2509.15962,
title = {Structured Information for Improving Spatial Relationships in Text-to-Image Generation},
author = {Sander Schildermans and Chang Tian and Ying Jiao and Marie-Francine Moens},
journal= {arXiv preprint arXiv:2509.15962},
year = {2025}
}
备注
text-to-image generation, structured information, spatial relationship