中文

LVLM-Composer的显式规划用于图像生成

计算机视觉与模式识别 2025-07-08 v1

摘要

生成式人工智能的新兴领域从根本上重塑了我们进行内容创作的方式,而大型视觉语言模型(LVLM)则处于其前沿。尽管当前的LVLM在文本到图像生成方面展示了令人印象深刻的能力,但当面对需要精确组合理解和视觉规划的复杂文本描述时,它们常常表现不佳。这种局限性尤其影响了对复杂场景中多个物体、其属性、空间关系和特定姿态的准确渲染,正如LongBench-T2I等基准测试所证明的那样。为了解决这些挑战,我们引入了LVLM-Composer,一个新颖的100亿参数规模的LVLM,专门为增强的组合图像合成而设计。我们的方法包含一个用于结构化提示分解的层次化语义规划模块,以及一个用于在生成过程中提供精确视觉引导的细粒度特征对齐机制。我们提出了一种多阶段训练范式,包括层次化语义-视觉基础预训练和带有自我修正的组合规划强化学习,以灌输鲁棒的组合推理能力。在LongBench-T2I基准测试上,利用Gemini-2.0-Flash和InternVL3-78B的自动评估进行的大量实验表明,LVLM-Composer在关键组合维度(包括物体准确性、组合保真度和姿态准确性)上表现出优越的性能,显著优于最先进的基线方法。深入的消融研究进一步验证了我们提出模块不可或缺的贡献,而人工评估则证实了我们生成图像的感知优越性。LVLM-Composer代表了向真正可控且组合准确的开放式文本到图像生成迈出的重要一步。

关键词

引用

@article{arxiv.2507.04152,
  title  = {LVLM-Composer's Explicit Planning for Image Generation},
  author = {Spencer Ramsey and Jeffrey Lee and Amina Grant},
  journal= {arXiv preprint arXiv:2507.04152},
  year   = {2025}
}