中文

循环一致性作为奖励:无需人类偏好的图像-文本对齐学习

计算机视觉与模式识别 2025-11-04 v2 机器学习

摘要

衡量语言与视觉之间的对齐是一个基本挑战,尤其是随着多模态数据变得日益详细和复杂。现有方法通常依赖于收集人类或AI的偏好,这可能成本高昂且耗时。我们提出了一种替代方法,利用循环一致性作为监督信号。给定一张图像和生成的文本,我们使用文本到图像模型将文本映射回图像空间,并计算原始图像与其重建之间的相似度。类似地,对于文本到图像生成,我们通过循环测量输入描述与其重建之间的文本相似度。我们使用循环一致性得分对候选进行排序,并构建了一个包含866K对比对的偏好数据集。在我们的数据集上训练的奖励模型CycleReward,在详细描述任务上优于SOTA对齐指标,当用作Best-of-N采样的验证器时具有卓越的推理时间可扩展性,同时保持了速度和可微性。此外,使用我们的数据集执行DPO和Diffusion DPO增强了在广泛的视觉-语言任务和文本到图像生成中的性能。我们的数据集、模型和代码已在 https://cyclereward.github.io 上公开发布。

关键词

引用

@article{arxiv.2506.02095,
  title  = {Cycle Consistency as Reward: Learning Image-Text Alignment without Human Preferences},
  author = {Hyojin Bahng and Caroline Chan and Fredo Durand and Phillip Isola},
  journal= {arXiv preprint arXiv:2506.02095},
  year   = {2025}
}