VILA-U:集成视觉理解与生成的统一基石模型
计算机视觉与模式识别
2025-03-05 v3 机器学习
摘要
VILA-U是一个集成了视频、图像、语言理解与生成的统一基石模型。传统的视觉语言模型(VLMs)为理解和生成视觉内容使用单独的模块,这可能导致对齐问题和增加复杂度。相比之下,VILA-U采用单一的自回归next-token预测框架用于两项任务,无需额外组件如扩散模型。这种方法不仅简化了模型,也在视觉语言理解和生成方面实现了接近最先进水平的性能。VILA-U的成功归功于两个主要因素:统一的视觉塔在预训练期间将离散视觉标记与文本输入对齐,从而增强了视觉感知;以及自回归图像生成可实现与扩散模型相似的质量,同时使用高质量数据集。这使得VILA-U能够在完全基于标记的自回归框架下,即可与更复杂的模型相媲美。
引用
@article{arxiv.2409.04429,
title = {VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation},
author = {Yecheng Wu and Zhuoyang Zhang and Junyu Chen and Haotian Tang and Dacheng Li and Yunhao Fang and Ligeng Zhu and Enze Xie and Hongxu Yin and Li Yi and Song Han and Yao Lu},
journal= {arXiv preprint arXiv:2409.04429},
year = {2025}
}
备注
Code: https://github.com/mit-han-lab/vila-u. The first two authors contributed equally to this work