信息种植:利用 MLLMs 在图像生成中培育情境一致性
计算机视觉与模式识别
2026-05-08 v2 人工智能
摘要
扩散模型源于物理中的扩散现象,描述粒子的随机运动和碰撞,扩散生成模型在数据空间中沿着去噪轨迹模拟随机漫步。这允许信息在各区域之间扩散,从而产生和谐的结果。然而,扩散模型中信息扩散的混乱和有序本质常常导致图像区域之间产生所需的干扰,导致细节保存受损和情境不一致。在本工作中,我们通过重新框架化无序扩散,以实现文本-视觉到图像生成(TV2I)任务,实现像素级条件忠诚度,同时保持视觉和语义一致性。我们首先引入循环单向扩散(COW),它为精确的信息传递提供了高效的单向扩散框架,同时最小化破坏性干扰。基于 COW,我们进一步提出选择性单向扩散(SOW),该方法利用多模态大语言模型(MLLMs)澄清图像中的语义和空间关系。基于这些见解,SOW 将注意力机制组合使用,动态地根据情境关系调节扩散的方向和强度。广泛的实验表明,受控信息扩散的潜力被充分挖掘,为更自适应和多功能的生成模型提供了学习无依赖的方式的路径。
引用
@article{arxiv.2411.19182,
title = {SOWing Information: Cultivating Contextual Coherence with MLLMs in Image Generation},
author = {Yuhan Pei and Ruoyu Wang and Yongqi Yang and Ye Zhu and Olga Russakovsky and Yu Wu},
journal= {arXiv preprint arXiv:2411.19182},
year = {2026}
}
备注
Project page: https://pyh-129.github.io/SOW/