中文

Match & Choose:面向微调文本到图像扩散模型的模型选择框架

机器学习 2025-08-18 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

基于扩散和变压器架构的文本到图像(T2I)模型正在快速发展。它们通常在大型语料库上进行预训练,并在模型平台(如HuggingFace)上公开共享。用户可以采用预训练的T2I模型并在目标数据集上进行微调来构建AI应用程序,如生成媒体内容。尽管公开的预训练T2I模型促进了模型的民主化,但用户面临新挑战:基于目标数据域,哪个模型最适合进行微调?在分类任务中已广泛解决模型选择问题,但关于(预训练)T2I模型及其在目标域上的性能指示知之甚少。本文提出首个模型选择框架M&C,使用户能够从模型平台高效选择最佳预训练T2I模型,而无需在目标数据集上对所有模型进行彻底微调。M&C的核心是一条匹配图,包含:(i)可用模型和已配置数据集的节点,以及(ii)模型-数据和数据-数据对的边,分别捕获微调性能和数据相似性。我们构建了一个模型,基于模型/数据特征以及——关键地——从匹配图中提取的图嵌入特征,预测在目标域进行微调后实现最佳质量的模型。我们在选择跨十个T2I模型用于32个数据集的情形下,对比了三个基线方法。我们的结果表明,M&C在61.3%的情况下成功预测实现最佳微调的模型,其余情况预测的模型也表现相当。

关键词

引用

@article{arxiv.2508.10993,
  title  = {Match & Choose: Model Selection Framework for Fine-tuning Text-to-Image Diffusion Models},
  author = {Basile Lewandowski and Robert Birke and Lydia Y. Chen},
  journal= {arXiv preprint arXiv:2508.10993},
  year   = {2025}
}