OneCAT: 统一理解与生成的仅解码器自回归模型
计算机视觉与模式识别
2025-10-08 v3
摘要
我们提出 OneCAT,一个统一的多模态模型,在一种新颖的纯仅解码器 Transformer 架构中无缝集成了理解、生成与编辑。我们的框架独特地消除了推理过程中对外部组件(如 Vision Transformer(ViT)或视觉分词器)的需求,从而在效率上取得了显著提升,尤其是在高分辨率输入方面。这是通过采用单一自回归(AR)目标训练的模态特定混合专家(MoE)结构实现的,该结构也原生支持动态分辨率。此外,我们在大型语言模型(LLM)中开创了一种多尺度视觉自回归机制,与基于扩散的方法相比,大幅减少了解码步骤,同时保持了最先进的性能。我们的发现表明,纯自回归建模作为统一多模态智能的充分且优雅的基础具有强大潜力。因此,OneCAT 设定了新的性能标准,在多模态生成、编辑和理解基准测试中超越了现有的开源统一多模态模型。
引用
@article{arxiv.2509.03498,
title = {OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation},
author = {Han Li and Xinyu Peng and Yaoming Wang and Zelin Peng and Xin Chen and Rongxiang Weng and Jingang Wang and Xunliang Cai and Wenrui Dai and Hongkai Xiong},
journal= {arXiv preprint arXiv:2509.03498},
year = {2025}
}
备注
technical report, project url:https://onecat-ai.github.io/