FOCUS:文本到图像生成中多实体世界建模的最优控制
计算机视觉与模式识别
2026-03-26 v2
摘要
文本到图像(T2I)模型在单实体提示词上表现优异,但在多实体场景中表现不佳,常出现属性泄漏、身份纠缠和主体遗漏。我们提出了一个有原则的理论框架,通过将流匹配(FM)转化为随机最优控制(SOC)来引导采样向多主体保真度靠拢,在保真度与以物体为中心的状态分离/绑定一致性之间产生单一超参数控制的权衡。在此框架内,我们推导出两种架构无关的算法:(i)一种无需训练的测试时控制器,通过单次传递更新扰动基础速度;以及(ii)Adjoint Matching,一种将控制网络回归至后向伴随信号的轻量级微调规则。相同的公式统一了先前的注意力启发式方法,通过流-扩散对应扩展至扩散模型,并提供了首个明确为多主体保真度设计的微调路径。此外,我们还引入了 FOCUS(Flow Optimal Control for Unentangled Subjects),一种与两种算法兼容的概率注意力绑定目标。在 Stable Diffusion 3.5 和 FLUX.1 上的实验表明,两种算法在保持基础模型风格的同时,持续改进多主体对齐;测试时控制在商用 GPU 上高效运行,微调后的模型能泛化至未见过的提示词。
引用
@article{arxiv.2510.02315,
title = {FOCUS: Optimal Control for Multi-Entity World Modeling in Text-to-Image Generation},
author = {Eric Tillmann Bill and Enis Simsar and Thomas Hofmann},
journal= {arXiv preprint arXiv:2510.02315},
year = {2026}
}
备注
Project Page: https://ericbill21.github.io/FOCUS/