解锁组合控制:基于LVLM的图像生成自监督方法
计算机视觉与模式识别
2025-07-08 v1
摘要
本文介绍了层次化自监督LVLM(Hi-SSLVLM),一种新颖的生成模型,旨在显著推进文本到图像的合成,特别是针对复杂且具有组合挑战性的提示。传统方法通常难以应对精心策划的配对图像-文本数据集的高昂成本,并且在精确控制细粒度视觉属性和复杂空间关系方面存在困难。我们的Hi-SSLVLM通过一种独特的两阶段自监督学习策略解决了这些限制。第一阶段,多粒度视觉-语言基础,使大型视觉语言模型(LVLM)主干能够自主生成并将层次化标题(全局和局部)与图像对齐,培养深层的内部语义理解,而无需依赖大量的人工标注。第二阶段,自我精炼与引导图像生成,通过内部组合规划(ICP)机制利用所获得的知识,其中LVLM首先制定详细的文本子提示来引导图像生成过程,并辅以新颖的语义一致性损失以实现精确的输出对齐。在多个维度的基准测试(如Gemini-2.0-Flash和InternVL3-78B)上,与领先的基线方法(包括Janus-Pro-1B、Stable Diffusion XL 1.0、DeepFloyd IF v1.0和ControlNet-XL)进行的全面实验表明,Hi-SSLVLM在所有细粒度指标上均表现出优越的性能。深入的消融研究证实了每个提出组件的关键作用。此外,人工评估证实了我们的定量发现,突显了Hi-SSLVLM在提示保真度、组合准确性和整体美学质量方面的增强,标志着向更可控和语义一致的开放式文本到图像生成迈出了重要一步。
引用
@article{arxiv.2507.04151,
title = {Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation},
author = {Fernando Gabriela Garcia and Spencer Burns and Ryan Shaw and Hunter Young},
journal= {arXiv preprint arXiv:2507.04151},
year = {2025}
}