中文

仅需提交一张图像以寻找最合适的生成模型

计算机视觉与模式识别 2024-12-18 v1 人工智能 机器学习

摘要

深度生成模型在图像生成方面取得了可喜的成果,并且已经开发了各种生成模型中心(例如 Hugging Face 和 Civitai),使模型开发者能够上传模型,用户能够下载模型。然而,这些模型中心缺乏高级的模型管理和识别机制,导致用户只能通过文本匹配、下载排序等方式搜索模型,难以高效找到最符合用户需求的模型。在本文中,我们提出了一种名为生成模型识别 (GMI) 的新设置,旨在使用户能够从大量候选模型中高效识别出最符合其需求的生成模型。据我们所知,这尚未被研究过。在本文中,我们引入了一个由三个关键模块组成的综合解决方案:用于捕获生成图像分布以及图像与提示之间关系的加权降维核均值嵌入 (RKME) 框架,旨在解决维度挑战的预训练视觉-语言模型,以及旨在解决跨模态问题的图像询问器。大量实证结果表明该提案既高效又有效。例如,用户只需提交一张示例图像来描述其需求,模型平台即可实现超过 80% 的平均 top-4 识别准确率。

关键词

引用

@article{arxiv.2412.12232,
  title  = {You Only Submit One Image to Find the Most Suitable Generative Model},
  author = {Zhi Zhou and Lan-Zhe Guo and Peng-Xiao Song and Yu-Feng Li},
  journal= {arXiv preprint arXiv:2412.12232},
  year   = {2024}
}

备注

Accepted by NeurIPS 2023 Workshop on Diffusion Models