UGen:采用渐进式词汇学习的统一自回归多模态模型
计算与语言
2025-03-28 v1 计算机视觉与模式识别
摘要
我们提出了 UGen,一个统一的自回归多模态模型,能够在文本处理、图像理解和图像生成任务上同时表现出强大的性能。UGen 将文本和图像均转换为离散 token 序列,并利用单个 Transformer 以自回归方式统一生成。为了应对统一多模态学习所面临的挑战,UGen 采用一种新颖的机制进行训练,即渐进式词汇学习(progressive vocabulary learning)。在该过程中,视觉 token ID 被逐步激活并整合到训练阶段,最终提升统一多模态学习的有效性。在全面的文本和图像任务上的实验表明,UGen 相比 vanilla 统一自回归方法取得了 13.3% 的显著整体性能提升,并且在所有任务上相较于多个任务专用模型也取得了具有竞争力的结果。
引用
@article{arxiv.2503.21193,
title = {UGen: Unified Autoregressive Multimodal Model with Progressive Vocabulary Learning},
author = {Hongxuan Tang and Hao Liu and Xinyan Xiao},
journal= {arXiv preprint arXiv:2503.21193},
year = {2025}
}