中文

基于标准下一词预测的统一理解、生成与编辑基线

计算机视觉与模式识别 2026-03-06 v1

摘要

本文引入Wallaroo,一个简单的自回归基线,利用下一词预测统一处理多模态理解、图像生成与编辑。此外,Wallaroo支持多分辨率的图像输入与输出,以及中英文双语支持。我们将视觉编码解耦为独立路径,并应用四阶段训练策略以重塑模型能力。在各种基准测试上进行实验,Wallaroo在表现上与其他统一模型持水平甚至超越,表明自回归模型在统一多模态理解与生成方面具有巨大潜力。我们的代码已公开于https://github.com/JiePKU/Wallaroo。

关键词

引用

@article{arxiv.2603.04980,
  title  = {A Simple Baseline for Unifying Understanding, Generation, and Editing via Vanilla Next-token Prediction},
  author = {Jie Zhu and Hanghang Ma and Jia Wang and Yayong Guan and Yanbing Zeng and Lishuai Gao and Junqiang Wu and Jie Hu and Leye Wang},
  journal= {arXiv preprint arXiv:2603.04980},
  year   = {2026}
}

备注

Technical report. This work serves as a straightforward autoregressive baseline for unifying understanding, generation, and editing