循环一致性作为奖励:无需人类偏好的图像-文本对齐学习
计算机视觉与模式识别
2025-11-04 v2 机器学习
摘要
衡量语言与视觉之间的对齐是一个基本挑战,尤其是随着多模态数据变得日益详细和复杂。现有方法通常依赖于收集人类或AI的偏好,这可能成本高昂且耗时。我们提出了一种替代方法,利用循环一致性作为监督信号。给定一张图像和生成的文本,我们使用文本到图像模型将文本映射回图像空间,并计算原始图像与其重建之间的相似度。类似地,对于文本到图像生成,我们通过循环测量输入描述与其重建之间的文本相似度。我们使用循环一致性得分对候选进行排序,并构建了一个包含866K对比对的偏好数据集。在我们的数据集上训练的奖励模型CycleReward,在详细描述任务上优于SOTA对齐指标,当用作Best-of-N采样的验证器时具有卓越的推理时间可扩展性,同时保持了速度和可微性。此外,使用我们的数据集执行DPO和Diffusion DPO增强了在广泛的视觉-语言任务和文本到图像生成中的性能。我们的数据集、模型和代码已在 https://cyclereward.github.io 上公开发布。
引用
@article{arxiv.2506.02095,
title = {Cycle Consistency as Reward: Learning Image-Text Alignment without Human Preferences},
author = {Hyojin Bahng and Caroline Chan and Fredo Durand and Phillip Isola},
journal= {arXiv preprint arXiv:2506.02095},
year = {2025}
}