GreenStableYolo:优化文本到图像生成的推理时间与图像质量
计算机视觉与模式识别
2024-07-23 v1 人工智能
摘要
调节参数与提示以改善 AI-based 文本到图像生成一直是一项实质性而未被充分解决的挑战。因此我们提出 GreenStableYolo,通过 NSGA-II 与 Yolo 来改善 Stable Diffusion 的参数与提示,从而在减少 GPU 推理时间和提高图像生成质量方面取得显著提升。我们的实验表明,尽管相较于仅考虑图像质量的 StableYolo 在图像质量上仅略有 18% 的牺牲,GreenStableYolo 实现了显著的推理时间缩减(缩短 266%),并实现了 526% 更高的超体积,从而推动了文本到图像生成的最新进展。
引用
@article{arxiv.2407.14982,
title = {GreenStableYolo: Optimizing Inference Time and Image Quality of Text-to-Image Generation},
author = {Jingzhi Gong and Sisi Li and Giordano d'Aloisio and Zishuo Ding and Yulong Ye and William B. Langdon and Federica Sarro},
journal= {arXiv preprint arXiv:2407.14982},
year = {2024}
}
备注
This paper is published in the SSBSE Challenge Track 2024