Kelix技术报告
计算机视觉与模式识别
2026-02-13 v3
摘要
自回归大语言模型(LLM)通过将多种任务表述为离散自然语言token序列,并采用下一token预测进行训练,能够很好地扩展,统一了理解与生成于自监督范式下。将这一范式扩展到多模态数据需要跨模态的共享离散表示。然而,大多数视觉语言模型(VLM)仍依赖混合界面:离散文本token配合连续Vision Transformer(ViT)特征。由于监督主要来自文本,这些模型常偏向于理解,无法充分利用非文本数据的大规模自监督学习。近期研究探索了离散视觉标记以实现完全自回归多模态建模,取得了向统一理解与生成靠拱的有希望进展。然而,现有离散视觉token常因编码容量有限导致信息丢失,导致理解能力显著弱于连续特征VLM。我们提出Kelix,一种完全离散自回归统一模型,闭合了离散与连续视觉表征之间理解的鸿沟。
引用
@article{arxiv.2602.09843,
title = {Kelix Technical Report},
author = {Boyang Ding and Chenglong Chu and Dunju Zang and Han Li and Jiangxia Cao and Kun Gai and Muhao Wei and Ruiming Tang and Shiyao Wang and Siyang Mao and Xinchen Luo and Yahui Liu and Zhixin Ling and Zhuoran Yang and Ziming Li and Chengru Song and Guorui Zhou and Guowang Zhang and Hao Peng and Hao Wang and Jiaxin Deng and Jin Ouyang and Jinghao Zhang and Lejian Ren and Qianqian Wang and Qigen Hu and Tao Wang and Xingmei Wang and Yiping Yang and Zixing Zhang and Ziqi Wang},
journal= {arXiv preprint arXiv:2602.09843},
year = {2026}
}
备注
Work in progress