VARGPT-v1.1:通过迭代指令调谐和强化学习改进视觉自回归大统一模型
计算机视觉与模式识别
2025-04-07 v1 人工智能
摘要
本文提出VARGPT-v1.1,这是一个在我们之前框架VARGPT基础上发展而来的先进视觉自回归模型。该模型保留了下一词预测用于视觉理解和下一尺度生成用于图像合成的双范式。具体而言,VARGPT-v1.1集成了:(1)一种结合迭代视觉指令调谐与通过直接偏好优化(DPO)实现的强化学习的新颖训练策略;(2)包含830万对视觉-生成指令对的扩充训练语料库;(3)采用Qwen2的升级语言模型 Backbone;(4)增强的图像生成分辨率;以及(5)无需架构修改即可实现的新出现的图像编辑功能。这些进展使VARGPT-v1.1在多模态理解和文本到图像指令跟随任务中实现了最先进的性能,显著提升了理解和生成指标。值得注意的是,通过视觉指令调谐,该模型获得了图像编辑功能,同时保持了与其前身的架构一致性,揭示了统一视觉理解、生成和编辑的潜力。我们的发现表明,经过精心设计的统一视觉自回归模型可以有效地采用大型语言模型(LLM)中灵活的训练策略,展现出良好的可扩展性。该项目代码和模型权重已公开于https://github.com/VARGPT-family/VARGPT-v1.1。
引用
@article{arxiv.2504.02949,
title = {VARGPT-v1.1: Improve Visual Autoregressive Large Unified Model via Iterative Instruction Tuning and Reinforcement Learning},
author = {Xianwei Zhuang and Yuxin Xie and Yufan Deng and Dongchao Yang and Liming Liang and Jinghan Ru and Yuguo Yin and Yuexian Zou},
journal= {arXiv preprint arXiv:2504.02949},
year = {2025}
}
备注
Code is available at: https://github.com/VARGPT-family/VARGPT-v1.1. arXiv admin note: text overlap with arXiv:2501.12327