中文

图像语音比分数:用于提升生成质量的失效模式逃逸

计算机视觉与模式识别 2025-08-14 v1

摘要

扩散模型在类到图像生成方面取得了显著进展. 然而, 我们注意到尽管FID分数令人印象深刻, 最先进的模型常常生成失真或低质量的图像, 尤其是在某些类别中. 这一差距源于FID评估全局分布对齐, 而忽略了单个样本的感知质量. 我们进一步检查了CFG的作用, 这是一种常用于提高生成质量的技术. 虽然有效于改善指标和抑制异常值, 但CFG会由于与训练目标和用户期望不一致, 引入分布偏移和视觉瑕疵. 在本工作中, 我们提出了FaME, 一种无训练且高效的推理方法, 用于提高感知质量. FaME使用图像质量评估模型识别低质量生成并存储其采样轨迹. 这些失效模式随后用作负向引导, 以引导未来采样远离差质量区域. 在ImageNet上的实验表明, FaME在视觉质量上实现了持续的改进, 而不会损害FID. FaME也显示出扩展到改进文本到图像生成的潜力.

关键词

引用

@article{arxiv.2508.09598,
  title  = {Images Speak Louder Than Scores: Failure Mode Escape for Enhancing Generative Quality},
  author = {Jie Shao and Ke Zhu and Minghao Fu and Guo-hua Wang and Jianxin Wu},
  journal= {arXiv preprint arXiv:2508.09598},
  year   = {2025}
}