中文

基于Janus-Pro-Dirven Prompt Parsing的高效多实例生成

计算机视觉与模式识别 2025-03-28 v1

摘要

近期的文本引导扩散模型进展在条件图像生成方面取得了突破,但在合成包含多个对象的复杂场景时仍面临空间定位不准和可扩展性有限的挑战。我们通过两个关键模块来解决这些挑战:1)Janus-Pro驱动的Prompt Parsing模块,通过一个紧凑的1B参数架构,将文本理解与布局生成桥接起来;2)MIGLoRA,一种集成Low-Rank Adaptation(LoRA)到UNet(SD1.5)和DiT(SD3)背bone的高效插件。MIGLoRA能够保留基础模型的参数,确保即插即用适应性,最小化架构干扰,同时实现高效微调。为支持全面评估,我们创建了DescripBox和DescripBox-1024基准数据集,涵盖多样化场景和分辨率。该方法在COCO和LVIS基准测试中实现了最先进的性能,同时保持参数效率,展示了在开放式合成中具有卓越的布局忠实性和可扩展性。

关键词

引用

@article{arxiv.2503.21069,
  title  = {Efficient Multi-Instance Generation with Janus-Pro-Dirven Prompt Parsing},
  author = {Fan Qi and Yu Duan and Changsheng Xu},
  journal= {arXiv preprint arXiv:2503.21069},
  year   = {2025}
}