Show-o: 统一多模态理解与生成的单一 Transformer
计算机视觉与模式识别
2025-09-09 v7
摘要
我们提出了一种统一的 Transformer,即 Show-o,统一了多模态理解与生成。不同于完全自回归模型,Show-o 将自回归模型与(离散)扩散模型统一,以适应处理各种和混合模态的输入和输出。该统一模型灵活支持广泛的视觉语言任务,包括视觉问答、文本到图像生成、文本引导的图像内切/外推以及混合模态生成。在各类基准测试中,它的表现与针对理解或生成各自优化的现有单一模型相当或更优,无论是参数规模还是其他方面。这显著凸显了其作为下一代基础模型的潜力。代码和模型已发布于 https://github.com/showlab/Show-o。
关键词
引用
@article{arxiv.2408.12528,
title = {Show-o: One Single Transformer to Unify Multimodal Understanding and Generation},
author = {Jinheng Xie and Weijia Mao and Zechen Bai and David Junhao Zhang and Weihao Wang and Kevin Qinghong Lin and Yuchao Gu and Zhijie Chen and Zhenheng Yang and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2408.12528},
year = {2025}
}
备注
ICLR 2025