用于多任务能力的文本到图像扩散模型升级改造
计算机视觉与模式识别
2025-03-18 v1 人工智能
摘要
文本到图像合成近年来取得了显著进展。许多尝试已被用于将文本到图像模型扩展以支持多种任务。然而,现有方法通常需要资源密集型的重新训练或额外参数来适应新任务,这使得模型在设备端部署时效率低下。我们提出了多任务升级改造(MTU),这是一种简单而有效的方法,用于扩展预训练文本到图像扩散模型的能力以支持多种图像到图像生成任务。MTU将扩散模型中的前馈网络(FFN)层替换为较小的FFN(称为专家),并将它们与动态路由机制相结合。据我们所知,MTU是首个将多任务处理与设备端兼容性无缝融合的多任务扩散建模方法,通过缓解参数膨胀问题来实现。我们表明,MTU在多个任务(包括图像编辑、超分辨率和图像修复)上的性能与单任务微调扩散模型相当,同时在延迟和计算负载(GFLOPs)方面与单任务微调模型保持相似。
引用
@article{arxiv.2503.11905,
title = {Upcycling Text-to-Image Diffusion Models for Multi-Task Capabilities},
author = {Ruchika Chavhan and Abhinav Mehrotra and Malcolm Chadwick and Alberto Gil Ramos and Luca Morreale and Mehdi Noroozi and Sourav Bhattacharya},
journal= {arXiv preprint arXiv:2503.11905},
year = {2025}
}
备注
Preprint