中文

群扩散变换器是无监督多任务学习者

计算机视觉与模式识别 2024-10-22 v1

摘要

尽管大型语言模型(LLM)凭借其任务无关性能力在自然语言处理领域取得了革命性进展,但视觉生成任务,如图像翻译、风格迁移和人物定制,仍严依赖于监督的、任务特定的数据集。本文引入了群扩散变换器(Group Diffusion Transformers, GDTs),一种新型框架,通过将其重新定义为组生成问题来统一多样化的视觉生成任务。在该方法中,同时生成一组相关图像,可选地以子集为条件。GDTs基于扩散变换器,并通过在图像之间拼接自注意力标记来实现最小的架构修改。这使模型能够通过基于标题的相关性隐式地捕获跨图像关系(例如身份特征、风格、布局、周围环境和颜色方案)。我们的设计利用来自多模态互联网文章、图像画廊和视频帧中大量图像组的无监督、任务无关的预训练。我们在包括picture book creation、font design、style transfer、sketching、colorization、drawing sequence generation和character customization等30个不同视觉生成任务中超过200个指令上的综合基准测试中,对GDTs进行了评估。我们的模型在没有任何额外微调或梯度更新的情况下实现了具竞争力的零样本性能。此外,消融研究确认了数据规模、组大小和模型设计等关键组件的有效性。这些结果表明,GDTs作为可扩展、通用视觉生成系统的潜力巨大。

关键词

引用

@article{arxiv.2410.15027,
  title  = {Group Diffusion Transformers are Unsupervised Multitask Learners},
  author = {Lianghua Huang and Wei Wang and Zhi-Fan Wu and Huanzhang Dou and Yupeng Shi and Yutong Feng and Chen Liang and Yu Liu and Jingren Zhou},
  journal= {arXiv preprint arXiv:2410.15027},
  year   = {2024}
}