引导至关重要:重新思考文本到图像生成的评估陷阱
计算机视觉与模式识别
2026-02-27 v1 人工智能
摘要
无条件引导 (CFG) 已帮助扩散模型在各领域实现出色的条件生成。近期涌现出更多扩散引导方法以提升生成质量和人类偏好。然而,这些新兴扩散引导方法是否真正实现了稳固且显著的改进?本文重新思考了扩散引导的最新进展。我们的工作主要包括四个方面。第一,我们揭示了一个关键评估陷阱:常见的人类偏好模型对大引导尺度存在强烈偏好。仅增加 CFG 尺度即可轻易提升定量评估分数,因为语义对齐强度大,即使图像质量严重受损(如过度饱和和伪影)也能实现。第二,我们引入一种新颖的引导感知评估 (GA-Eval) 框架,通过有效引导尺度校准实现公平比较,区分当前引导方法与 CFG 的正交与平行效应。第三,受评估陷阱启发,我们设计了超越扩散引导 (TDG) 方法,在常规评估框架中显著提升人类偏好分数,但实际并不实用。第四,在大量实验中,我们在常规评估框架和提出的 GA-Eval 框架中对最新八种扩散引导方法进行经验性评估。值得注意的是,仅增加 CFG 尺度即可与大多数研究的扩散引导方法抗衡,而所有方法在标准 CFG 下都严重遭受获胜率下降。我们的工作将强烈激励社区重新思考评估范式和本领的未来方向。
引用
@article{arxiv.2602.22570,
title = {Guidance Matters: Rethinking the Evaluation Pitfall for Text-to-Image Generation},
author = {Dian Xie and Shitong Shao and Lichen Bai and Zikai Zhou and Bojun Cheng and Shuo Yang and Jun Wu and Zeke Xie},
journal= {arXiv preprint arXiv:2602.22570},
year = {2026}
}