基于标准下一词预测的统一理解、生成与编辑基线
计算机视觉与模式识别
2026-03-06 v1
摘要
本文引入Wallaroo,一个简单的自回归基线,利用下一词预测统一处理多模态理解、图像生成与编辑。此外,Wallaroo支持多分辨率的图像输入与输出,以及中英文双语支持。我们将视觉编码解耦为独立路径,并应用四阶段训练策略以重塑模型能力。在各种基准测试上进行实验,Wallaroo在表现上与其他统一模型持水平甚至超越,表明自回归模型在统一多模态理解与生成方面具有巨大潜力。我们的代码已公开于https://github.com/JiePKU/Wallaroo。
引用
@article{arxiv.2603.04980,
title = {A Simple Baseline for Unifying Understanding, Generation, and Editing via Vanilla Next-token Prediction},
author = {Jie Zhu and Hanghang Ma and Jia Wang and Yayong Guan and Yanbing Zeng and Lishuai Gao and Junqiang Wu and Jie Hu and Leye Wang},
journal= {arXiv preprint arXiv:2603.04980},
year = {2026}
}
备注
Technical report. This work serves as a straightforward autoregressive baseline for unifying understanding, generation, and editing