InstructEngine:面向指令的文本到图像对齐
计算机视觉与模式识别
2025-04-22 v2
摘要
从人类/AI反馈中进行强化学习(RLHF/RLAIF)已被广泛用于文本到图像模型的偏好对齐。现有方法在数据和算法方面存在局限。关于数据,大多数方法依赖手动标注的偏好数据,或通过微调生成器,或训练奖励模型以提供训练信号。然而,高标注成本使其难以规模化,奖励模型额外计算且无法保证准确性。从算法角度,大多数方法忽视文本的价值,仅将图像反馈作为比较信号,这既低效又稀疏。为缓解这些缺陷,我们提出了InstructEngine框架。关于标注成本,我们首先为文本到图像生成构建了分类学,然后在其基础上开发自动化数据构建管道。利用先进的大型多模态模型和人类定义的规则,我们生成了25K条文本-图像偏好对。最后,我们引入交叉验证对齐方法,通过组织语义相似样本形成可比较对来提升数据效率。在DrawBench上的评估表明,InstructEngine使SD v1.5和SDXL的性能分别提升了10.53%和5.30%,超越了最先进的基线,消融实验确认了InstructEngine各组件的益处。在人类评审中,获胜率超过50%也证明了InstructEngine更好地对齐了人类偏好。
引用
@article{arxiv.2504.10329,
title = {InstructEngine: Instruction-driven Text-to-Image Alignment},
author = {Xingyu Lu and Yuhang Hu and YiFan Zhang and Kaiyu Jiang and Changyi Liu and Tianke Zhang and Jinpeng Wang and Chun Yuan and Bin Wen and Fan Yang and Tingting Gao and Di Zhang},
journal= {arXiv preprint arXiv:2504.10329},
year = {2025}
}
备注
8 pages, 7 figures