中文

RFMI:在Rectified Flow上估计互信息以实现文本到图像对齐

计算机视觉与模式识别 2025-03-19 v1 机器学习

摘要

采用Flow matching框架训练的Rectified Flow(RF)模型在文本到图像(T2I)条件生成方面取得了最先进的性能。然而,多个基准测试表明,合成图像仍可能与提示词对齐不佳,即图像出现错误的属性绑定、主体定位、数字识别等问题。尽管文献中提供了许多改善T2I对齐的方法,但它们均仅考虑扩散模型,且需要辅助数据集、评分模型以及对提示词的语言学分析。本论文旨在解决这些不足。首先,我们提出了RFMI,一种用于RF模型的新型互信息(MI)估计器,该估计器利用预训练模型本身进行MI估计。然后,我们研究了一种基于RFMI的自监督微调方法,用于T2I对齐,该方法除了预训练模型本身外不需要任何辅助信息。具体而言,通过从预训练的RF模型生成的合成图像中选取与提示词具有高逐点MI的图像来构建微调集。我们在MI估计基准测试上的实验验证了RFMI的有效性,而在SD3.5-Medium上的经验性微调实验证实了RFMI在改善T2I对齐的同时保持图像质量的有效性。

关键词

引用

@article{arxiv.2503.14358,
  title  = {RFMI: Estimating Mutual Information on Rectified Flow for Text-to-Image Alignment},
  author = {Chao Wang and Giulio Franzese and Alessandro Finamore and Pietro Michiardi},
  journal= {arXiv preprint arXiv:2503.14358},
  year   = {2025}
}

备注

to appear at ICLR 2025 Workshop on Deep Generative Model in Machine Learning: Theory, Principle and Efficacy