FlashEval:面向文本到图像扩散生成模型的快速准确评估
计算机视觉与模式识别
2024-03-26 v1
摘要
近年来,文本到图像生成模型的发展取得了显著进展。评估生成模型的质量是开发过程中的关键步骤之一。遗憾的是,评估过程可能消耗大量计算资源,使得所需的模型性能定期评估(例如监控训练进度)变得不切实际。因此,我们寻求通过选择文本-图像数据集的代表性子集来提高评估效率。我们系统地研究了设计选择,包括选择标准(文本特征或基于图像的度量)和选择粒度(提示级或集合级)。我们发现,先前关于训练数据子集选择的工作中的见解并不能推广到这一问题,并提出了FlashEval,一种专为评估数据选择定制的迭代搜索算法。我们展示了FlashEval在COCO和DiffusionDB数据集上对具有各种配置(包括架构、量化级别和采样器调度)的扩散模型进行排名的有效性。我们搜索出的50项子集在未见过的模型上对COCO标注可达到与随机采样的500项子集相当的评估质量,实现了10倍的评估加速。我们发布了这些常用数据集的精简子集,以帮助促进扩散算法的设计与评估,并将FlashEval开源作为精简未来数据集的工具,可访问https://github.com/thu-nics/FlashEval。
引用
@article{arxiv.2403.16379,
title = {FlashEval: Towards Fast and Accurate Evaluation of Text-to-image Diffusion Generative Models},
author = {Lin Zhao and Tianchen Zhao and Zinan Lin and Xuefei Ning and Guohao Dai and Huazhong Yang and Yu Wang},
journal= {arXiv preprint arXiv:2403.16379},
year = {2024}
}
备注
The paper is accepted by CVPR 2024