MILR:通过测试时潜在推理改进多模态图像生成
计算机视觉与模式识别
2026-02-11 v3 人工智能
摘要
推理增强的机器学习系统在包括图像生成在内的多个领域都表现出性能提升。然而,现有的基于推理的图像生成方法要么将推理限制在单一模态(图像或文本),要么依赖高质量的推理数据进行微调。为了解决这些局限性,我们提出了 MILR,这是一种在统一的潜在向量空间中对图像和文本进行联合推理的测试时方法。MILR 中的推理是通过搜索离散图像和文本标记的向量表示来执行的。实际上,这是通过策略梯度方法实现的,并由图像质量评价器引导。我们在统一的多模态理解与生成(MUG)框架内实例化了 MILR,该框架原生支持在图像合成之前进行语言推理,从而促进了跨模态推理。待优化的中间模型输出作为统一的潜在空间,使 MILR 能够完全在测试时运行。我们在 GenEval、T2I-CompBench 和 WISE 上评估了 MILR,在所有基准测试中都取得了最先进的结果。值得注意的是,在知识密集型的 WISE 上,MILR 获得了 0.63 的总分,比基线提高了 80%。我们的进一步分析表明,在统一潜在空间中的联合推理是其强大性能的关键。此外,我们的定性研究揭示了 MILR 在时间和文化推理方面的非凡能力,凸显了我们推理方法的有效性。
引用
@article{arxiv.2509.22761,
title = {MILR: Improving Multimodal Image Generation via Test-Time Latent Reasoning},
author = {Yapeng Mi and Yanpeng Zhao and Hengli Li and Chenxi Li and Huimin Wu and Xiaojian Ma and Song-Chun Zhu and Ying Nian Wu and Qing Li},
journal= {arXiv preprint arXiv:2509.22761},
year = {2026}
}
备注
21 pages,14 figures,9 tables