IDEA-Bench:生成模型距离专业设计还有多远?
计算机视觉与模式识别
2024-12-17 v1
摘要
真实世界的设计任务——例如图画书创作、使用角色集的电影故事板开发、照片修饰、视觉效果和字体迁移——高度多样且复杂,需要从指令、描述和参考图像中深度解释和提取各种元素。生成的图像通常隐式地捕获来自参考或用户输入的关键特征,这使得开发能够有效处理此类多样化任务的模型具有挑战性。虽然现有的视觉生成模型可以根据提示生成高质量图像,但在涉及多种形式和多个输入输出的专业设计场景中,即使通过ControlNets和LoRAs等适配器增强,它们也面临显著限制。为了解决这个问题,我们引入了IDEA-Bench,一个全面的基准测试,包含100个真实世界的设计任务,包括渲染、视觉效果、故事板、图画书、字体、基于风格和身份保持的生成,以及275个测试用例,以全面评估模型的通用生成能力。值得注意的是,即使性能最好的模型在IDEA-Bench上也只达到22.48,而最好的通用模型仅达到6.81。我们提供了这些结果的详细分析,突出了固有的挑战,并提供了可行的改进方向。此外,我们提供了一个由18个代表性任务组成的子集,配备了基于多模态大语言模型(MLLM)的自动评估技术,以促进快速模型开发和比较。我们在https://github.com/ali-vilab/IDEA-Bench发布了基准数据、评估工具包和在线排行榜,旨在推动生成模型向更通用和适用的智能设计系统发展。
引用
@article{arxiv.2412.11767,
title = {IDEA-Bench: How Far are Generative Models from Professional Designing?},
author = {Chen Liang and Lianghua Huang and Jingwu Fang and Huanzhang Dou and Wei Wang and Zhi-Fan Wu and Yupeng Shi and Junge Zhang and Xin Zhao and Yu Liu},
journal= {arXiv preprint arXiv:2412.11767},
year = {2024}
}