中文

FocusDiff:通过强化学习提高自回归视觉生成中细粒度文本-图像对齐

计算机视觉与模式识别 2025-06-09 v1

摘要

最近的研究将自回归范式扩展到文本到图像生成,实现了与扩散模型相当的性能。然而,我们新的PairComp基准——包含语法相似但语义细粒度不同的配对提示测试用例——揭示了现有模型在细粒度文本-图像对齐方面存在挑战,无法实现对视觉标记的精确控制。为此,我们提出FocusDiff,通过聚焦于类似文本-图像对之间细微差异来增强细粒度文本-图像语义对齐。我们构建了一个由配对文本和图像组成的新数据集,这些文本和图像整体表达相似但局部语义不同,进而引入一种新型强化学习算法,以强调此类细粒度语义差异以实现所需的图像生成。我们的方法在现有文本到图像基准测试上实现了最先进的性能,并在PairComp上显著优于先前方法。

关键词

引用

@article{arxiv.2506.05501,
  title  = {FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL},
  author = {Kaihang Pan and Wendong Bu and Yuruo Wu and Yang Wu and Kai Shen and Yunfei Li and Hang Zhao and Juncheng Li and Siliang Tang and Yueting Zhuang},
  journal= {arXiv preprint arXiv:2506.05501},
  year   = {2025}
}

备注

15 pages, 8 figures. Project Page: https://focusdiff.github.io/