我们是否需要为不同任务设计特定的扩散模型?试试 ONE-PIC
计算机视觉与模式识别
2024-12-10 v1
摘要
大型预训练扩散模型已经展示了令人印象深刻的生成能力,并被适配到各种下游任务。然而,与可以根据指令数据在单一模型中学习多项任务的大型语言模型(LLMs)不同,扩散模型始终需要额外的分支、特定任务的训练策略和损失函数,才能有效地适配不同的下游任务。这种特定任务的微调方法带来了两个缺点。1) 特定任务的额外网络在预训练和微调之间产生了差距,阻碍了预训练知识的迁移。2) 它需要仔细设计额外网络,提高了学习和实现的难度,降低了用户友好性。因此,一个问题出现了:我们能否实现一种简单、高效且通用的扩散模型微调方法?为此,我们提出了ONE-PIC。它在不引入额外模块的情况下增强了预训练扩散模型中继承的生成能力。具体而言,我们提出了In-Visual-Context Tuning,通过将源图像和目标图像排列在一张图像中来构建特定任务的训练数据。这种方法使下游微调更贴近相关任务,使我们的模型能够更快地适应各种下游任务。此外,我们提出了一种掩码策略来统一不同的生成任务。该策略将各种下游微调任务转化为对被遮挡部分的预测。广泛的实验结果表明,我们的方法简单高效,简化了适配过程,并以较低的成本取得了优异的性能。代码可在 https://github.com/tobran/ONE-PIC 获取。
引用
@article{arxiv.2412.05619,
title = {Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC},
author = {Ming Tao and Bing-Kun Bao and Yaowei Wang and Changsheng Xu},
journal= {arXiv preprint arXiv:2412.05619},
year = {2024}
}
备注
11 pages, 11 figures