中文

文本到图像生成模型的多模态基准评测与推荐

图形学 2025-05-09 v1 人工智能 信息检索 机器学习

摘要

本工作提出了一个开源的统一基准评测与评估框架,用于文本到图像生成模型,特别关注元数据增强提示的影响。利用DeepFashion-MultiModal数据集,我们通过一套全面的定量指标评估生成输出,包括加权得分、基于CLIP(对比语言-图像预训练)的相似度、LPIPS(学习感知图像块相似度)、FID(弗雷歇初始距离)和基于检索的度量,以及定性分析。我们的结果表明,结构化的元数据丰富极大地增强了跨多种文本到图像架构的视觉真实感、语义保真度和模型鲁棒性。虽然不是一个传统的推荐系统,但我们的框架能够基于评估指标,为模型选择和提示设计提供针对特定任务的推荐。

关键词

引用

@article{arxiv.2505.04650,
  title  = {Multimodal Benchmarking and Recommendation of Text-to-Image Generation Models},
  author = {Kapil Wanaskar and Gaytri Jena and Magdalini Eirinaki},
  journal= {arXiv preprint arXiv:2505.04650},
  year   = {2025}
}