CHATS:结合人类对齐优化与测试时抽样用于文本到图像生成
计算机视觉与模式识别
2025-06-10 v3
摘要
扩散模型已成为文本到图像生成的主导方法。诸如人类偏好对齐和无分类器引导等关键组件在确保生成质量方面发挥着关键作用。然而,这些方法在当前文本到图像模型中独立应用,仍面临在实现强文本-图像对齐、高生成质量和与人类审美标准一致性方面存在显著挑战。本文首次探索在文本到图像模型中促进人类绩效对齐与测试时抽样协作,以发掘文本到图像模型的潜力。Consequently,我们引入 CHATS (Combining Human-Aligned optimization and Test-time Sampling),一种新型生成框架,分别建模受偏好和不偏好分布,并采用基于代理提示的抽样策略利用这两种分布中包含的有用信息。我们观察到 CHATS 在数据效率方面表现出色,仅需小规模高质量微调数据集即可实现卓越性能。广泛的实验表明,CHATS 超越了传统的偏好对齐方法,在各种标准基准上均取得新的状态-of-the-art 成绩。
引用
@article{arxiv.2502.12579,
title = {CHATS: Combining Human-Aligned Optimization and Test-Time Sampling for Text-to-Image Generation},
author = {Minghao Fu and Guo-Hua Wang and Liangfu Cao and Qing-Guo Chen and Zhao Xu and Weihua Luo and Kaifu Zhang},
journal= {arXiv preprint arXiv:2502.12579},
year = {2025}
}
备注
ICML 2025. The code is publicly available at https://github.com/AIDC-AI/CHATS