English
Related papers

Related papers: A Simple Baseline for Unifying Understanding, Gene…

200 papers

In this work, we address two limitations of existing conditional diffusion models: their slow inference speed due to the iterative denoising process and their reliance on paired data for model fine-tuning. To tackle these issues, we…

Computer Vision and Pattern Recognition · Computer Science 2024-03-19 Gaurav Parmar , Taesung Park , Srinivasa Narasimhan , Jun-Yan Zhu

Word translation without parallel corpora has become feasible, rivaling the performance of supervised methods. Recent findings have shown that the accuracy and robustness of unsupervised word translation (UWT) can be improved by making use…

Computation and Language · Computer Science 2022-11-08 Tuan Dinh , Jy-yong Sohn , Shashank Rajput , Timothy Ossowski , Yifei Ming , Junjie Hu , Dimitris Papailiopoulos , Kangwook Lee

Tokenization is a foundational step in the text process of Large Language Models (LLMs). Texts must be first tokenized into token IDs, which are then input to LLMs. Inefficient tokenization results in long token-ID sequences and will slow…

Computation and Language · Computer Science 2026-05-14 Chong Li , Yingzhuo Deng , Wen Yang , Jiajun Zhang , Chengqing Zong

Unified understanding and generation is a highly appealing research direction in multimodal learning. There exist two approaches: one trains a transformer via an auto-regressive paradigm, and the other adopts a two-stage scheme connecting…

Computer Vision and Pattern Recognition · Computer Science 2025-12-09 Shihao Zhao , Yitong Chen , Zeyinzi Jiang , Bojia Zi , Shaozhe Hao , Yu Liu , Chaojie Mao , Kwan-Yee K. Wong

Unified multimodal models have recently demonstrated strong generative capabilities, yet whether and when generation improves understanding remains unclear. Existing benchmarks lack a systematic exploration of the specific tasks where…

Computer Vision and Pattern Recognition · Computer Science 2026-03-04 Zimo Wen , Boxiu Li , Wanbo Zhang , Junxiang Lei , Xiaoyu Chen , Yijia Fan , Qi Zhang , Yujiang Wang , Lili Qiu , Bo Li , Ziwei Liu , Caihua Shan , Yifan Yang , Yifei Shen

Unified multimodal models aim to integrate understanding (text output) and generation (pixel output), but aligning these different modalities within a single architecture often demands complex training recipes and careful data balancing. We…

Computer Vision and Pattern Recognition · Computer Science 2025-04-09 Xichen Pan , Satya Narayan Shukla , Aashu Singh , Zhuokai Zhao , Shlok Kumar Mishra , Jialiang Wang , Zhiyang Xu , Jiuhai Chen , Kunpeng Li , Felix Juefei-Xu , Ji Hou , Saining Xie

We empirically study autoregressive pre-training from videos. To perform our study, we construct a series of autoregressive video models, called Toto. We treat videos as sequences of visual tokens and train transformer models to…

Computer Vision and Pattern Recognition · Computer Science 2025-01-10 Jathushan Rajasegaran , Ilija Radosavovic , Rahul Ravishankar , Yossi Gandelsman , Christoph Feichtenhofer , Jitendra Malik

Diffusion models have gained tremendous success in text-to-image generation, yet still lag behind with visual understanding tasks, an area dominated by autoregressive vision-language models. We propose a large-scale and fully end-to-end…

Computer Vision and Pattern Recognition · Computer Science 2025-04-03 Zijie Li , Henry Li , Yichun Shi , Amir Barati Farimani , Yuval Kluger , Linjie Yang , Peng Wang

In this report, we introduce ERNIE 5.0, a natively autoregressive foundation model desinged for unified multimodal understanding and generation across text, image, video, and audio. All modalities are trained from scratch under a unified…

Computation and Language · Computer Science 2026-02-05 Haifeng Wang , Hua Wu , Tian Wu , Yu Sun , Jing Liu , Dianhai Yu , Yanjun Ma , Jingzhou He , Zhongjun He , Dou Hong , Qiwen Liu , Shuohuan Wang , Junyuan Shang , Zhenyu Zhang , Yuchen Ding , Jinle Zeng , Jiabin Yang , Liang Shen , Ruibiao Chen , Weichong Yin , Siyu Ding , Dai Dai , Shikun Feng , Siqi Bao , Bolei He , Yan Chen , Zhenyu Jiao , Ruiqing Zhang , Zeyu Chen , Qingqing Dang , Kaipeng Deng , Jiajun Jiang , Enlei Gong , Guoxia Wang , Yanlin Sha , Yi Liu , Yehan Zheng , Weijian Xu , Jiaxiang Liu , Zengfeng Zeng , Yingqi Qu , Zhongli Li , Zhengkun Zhang , Xiyang Wang , Zixiang Xu , Xinchao Xu , Zhengjie Huang , Dong Wang , Bingjin Chen , Yue Chang , Xing Yuan , Shiwei Huang , Qiao Zhao , Xinzhe Ding , Shuangshuang Qiao , Baoshan Yang , Bihong Tang , Bin Li , Bingquan Wang , Binhan Tang , Binxiong Zheng , Bo Cui , Bo Ke , Bo Zhang , Bowen Zhang , Boyan Zhang , Boyang Liu , Caiji Zhang , Can Li , Chang Xu , Chao Pang , Chao Zhang , Chaoyi Yuan , Chen Chen , Cheng Cui , Chenlin Yin , Chun Gan , Chunguang Chai , Chuyu Fang , Cuiyun Han , Dan Zhang , Danlei Feng , Danxiang Zhu , Dong Sun , Dongbo Li , Dongdong Li , Dongdong Liu , Dongxue Liu , Fan Ding , Fan Hu , Fan Li , Fan Mo , Feisheng Wu , Fengwei Liu , Gangqiang Hu , Gaofeng Lu , Gaopeng Yong , Gexiao Tian , Guan Wang , Guangchen Ni , Guangshuo Wu , Guanzhong Wang , Guihua Liu , Guishun Li , Haibin Li , Haijian Liang , Haipeng Ming , Haisu Wang , Haiyang Lu , Haiye Lin , Han Zhou , Hangting Lou , Hanwen Du , Hanzhi Zhang , Hao Chen , Hao Du , Hao Liu , Hao Zhou , Haochen Jiang , Haodong Tian , Haoshuang Wang , Haozhe Geng , Heju Yin , Hong Chen , Hongchen Xue , Hongen Liu , Honggeng Zhang , Hongji Xu , Hongwei Chen , Hongyang Zhang , Hongyuan Zhang , Hua Lu , Huan Chen , Huan Wang , Huang He , Hui Liu , Hui Zhong , Huibin Ruan , Jiafeng Lu , Jiage Liang , Jiahao Hu , Jiahao Hu , Jiajie Yang , Jialin Li , Jian Chen , Jian Wu , Jianfeng Yang , Jianguang Jiang , Jianhua Wang , Jianye Chen , Jiaodi Liu , Jiarui Zhou , Jiawei Lv , Jiaxin Zhou , Jiaxuan Liu , Jie Han , Jie Sun , Jiefan Fang , Jihan Liu , Jihua Liu , Jing Hu , Jing Qian , Jing Yan , Jingdong Du , Jingdong Wang , Jingjing Wu , Jingyong Li , Jinheng Wang , Jinjin Li , Jinliang Lu , Jinlin Yu , Jinnan Liu , Jixiang Feng , Jiyi Huang , Jiyuan Zhang , Jun Liang , Jun Xia , Jun Yu , Junda Chen , Junhao Feng , Junhong Xiang , Junliang Li , Kai Liu , Kailun Chen , Kairan Su , Kang Hu , Kangkang Zhou , Ke Chen , Ke Wei , Kui Huang , Kun Wu , Kunbin Chen , Lei Han , Lei Sun , Lei Wen , Linghui Meng , Linhao Yu , Liping Ouyang , Liwen Zhang , Longbin Ji , Longzhi Wang , Meng Sun , Meng Tian , Mengfei Li , Mengqi Zeng , Mengyu Zhang , Ming Hong , Mingcheng Zhou , Mingming Huang , Mingxin Chen , Mingzhu Cai , Naibin Gu , Nemin Qiu , Nian Wang , Peng Qiu , Peng Zhao , Pengyu Zou , Qi Wang , Qi Xin , Qian Wang , Qiang Zhu , Qianhui Luo , Qianwei Yang , Qianyue He , Qifei Wu , Qinrui Li , Qiwen Bao , Quan Zhang , Quanxiang Liu , Qunyi Xie , Rongrui Zhan , Rufeng Dai , Rui Peng , Ruian Liu , Ruihao Xu , Ruijie Wang , Ruixi Zhang , Ruixuan Liu , Runsheng Shi , Ruting Wang , Senbo Kang , Shan Lu , Shaofei Yu , Shaotian Gong , Shenwei Hu , Shifeng Zheng , Shihao Guo , Shilong Fan , Shiqin Liu , Shiwei Gu , Shixi Zhang , Shuai Yao , Shuang Zhang , Shuangqiao Liu , Shuhao Liang , Shuwei He , Shuwen Yang , Sijun He , Siming Dai , Siming Wu , Siyi Long , Songhe Deng , Suhui Dong , Suyin Liang , Teng Hu , Tianchan Xu , Tianliang Lv , Tianmeng Yang , Tianyi Wei , Tiezhu Gao , Ting Sun , Ting Zhang , Tingdan Luo , Wei He , Wei Luan , Wei Yin , Wei Zhang , Wei Zhou , Weibao Gong , Weibin Li , Weicheng Huang , Weichong Dang , Weiguo Zhu , Weilong Zhang , Weiqi Tan , Wen Huang , Wenbin Chang , Wenjing Du , Wenlong Miao , Wenpei Luo , Wenquan Wu , Xi Shi , Xi Zhao , Xiang Gao , Xiangguo Zhang , Xiangrui Yu , Xiangsen Wang , Xiangzhe Wang , Xianlong Luo , Xianying Ma , Xiao Tan , Xiaocong Lin , Xiaofei Wang , Xiaofeng Peng , Xiaofeng Wu , Xiaojian Xu , Xiaolan Yuan , Xiaopeng Cui , Xiaotian Han , Xiaoxiong Liu , Xiaoxu Fei , Xiaoxuan Wu , Xiaoyu Wang , Xiaoyu Zhang , Xin Sun , Xin Wang , Xinhui Huang , Xinming Zhu , Xintong Yu , Xinyi Xu , Xinyu Wang , Xiuxian Li , XuanShi Zhu , Xue Xu , Xueying Lv , Xuhong Li , Xulong Wei , Xuyi Chen , Yabing Shi , Yafeng Wang , Yamei Li , Yan Liu , Yanfu Cheng , Yang Gao , Yang Liang , Yang Wang , Yang Wang , Yang Yang , Yanlong Liu , Yannian Fu , Yanpeng Wang , Yanzheng Lin , Yao Chen , Yaozong Shen , Yaqian Han , Yehua Yang , Yekun Chai , Yesong Wang , Yi Song , Yichen Zhang , Yifei Wang , Yifeng Guo , Yifeng Kou , Yilong Chen , Yilong Guo , Yiming Wang , Ying Chen , Ying Wang , Yingsheng Wu , Yingzhan Lin , Yinqi Yang , Yiran Xing , Yishu Lei , Yixiang Tu , Yiyan Chen , Yong Zhang , Yonghua Li , Yongqiang Ma , Yongxing Dai , Yongyue Zhang , Yu Ran , Yu Sun , Yu-Wen Michael Zhang , Yuang Liu , Yuanle Liu , Yuanyuan Zhou , Yubo Zhang , Yuchen Han , Yucheng Wang , Yude Gao , Yuedong Luo , Yuehu Dong , Yufeng Hu , Yuhui Cao , Yuhui Yun , Yukun Chen , Yukun Gao , Yukun Li , Yumeng Zhang , Yun Fan , Yun Ma , Yunfei Zhang , Yunshen Xie , Yuping Xu , Yuqin Zhang , Yuqing Liu , Yurui Li , Yuwen Wang , Yuxiang Lu , Zefeng Cai , Zelin Zhao , Zelun Zhang , Zenan Lin , Zezhao Dong , Zhaowu Pan , Zhaoyu Liu , Zhe Dong , Zhe Zhang , Zhen Zhang , Zhengfan Wu , Zhengrui Wei , Zhengsheng Ning , Zhenxing Li , Zhenyu Li , Zhenyu Qian , Zhenyun Li , Zhi Li , Zhichao Chen , Zhicheng Dong , Zhida Feng , Zhifan Feng , Zhihao Deng , Zhijin Yu , Zhiyang Chen , Zhonghui Zheng , Zhuangzhuang Guo , Zhujun Zhang , Zhuo Sun , Zichang Liu , Zihan Lin , Zihao Huang , Zihe Zhu , Ziheng Zhao , Ziping Chen , Zixuan Zhu , Ziyang Xu , Ziyi Liang , Ziyuan Gao

Visual autoregressive models typically adhere to a raster-order ``next-token prediction" paradigm, which overlooks the spatial and temporal locality inherent in visual content. Specifically, visual tokens exhibit significantly stronger…

Computer Vision and Pattern Recognition · Computer Science 2025-03-17 Yefei He , Yuanyu He , Shaoxuan He , Feng Chen , Hong Zhou , Kaipeng Zhang , Bohan Zhuang

Visual restoration and recognition are traditionally addressed in pipeline fashion, i.e. denoising followed by classification. Instead, observing correlations between the two tasks, for example clearer image will lead to better…

Computer Vision and Pattern Recognition · Computer Science 2016-12-06 Gang Chen , Yawei Li , Sargur N. Srihari

Autoregressive models have emerged as a powerful approach for visual generation but suffer from slow inference speed due to their sequential token-by-token prediction process. In this paper, we propose a simple yet effective approach for…

Computer Vision and Pattern Recognition · Computer Science 2025-04-04 Yuqing Wang , Shuhuai Ren , Zhijie Lin , Yujin Han , Haoyuan Guo , Zhenheng Yang , Difan Zou , Jiashi Feng , Xihui Liu

While next-token prediction is considered a promising path towards artificial general intelligence, it has struggled to excel in multimodal tasks, which are still dominated by diffusion models (e.g., Stable Diffusion) and compositional…

Vision-and-language (VL) pre-training, which aims to learn a general representation of image-text pairs that can be transferred to various vision-and-language tasks. Compared with modeling uni-modal data, the main challenge of the VL model…

Computation and Language · Computer Science 2023-05-24 Hao Yang , Can Gao , Hao Líu , Xinyan Xiao , Yanyan Zhao , Bing Qin

Data wrangling, the process of cleaning, transforming, and preparing data for analysis, is a well-known bottleneck in data science workflows. A wide range of data wrangling techniques have been proposed to mitigate this challenge. Of…

Recent advances in large language models (LLMs) have opened new avenues for multimodal reasoning. Yet, most existing methods still rely on pretrained vision-language models (VLMs) to encode image-text pairs in isolation, ignoring the…

Computer Vision and Pattern Recognition · Computer Science 2026-03-27 Yuanfu Sun , Kang Li , Pengkang Guo , Jiajin Liu , Qiaoyu Tan

Recent advancements in multimodal foundation models have yielded significant progress in vision-language understanding. Initial attempts have also explored the potential of multimodal large language models (MLLMs) for visual content…

Computer Vision and Pattern Recognition · Computer Science 2024-10-22 Rongyao Fang , Chengqi Duan , Kun Wang , Hao Li , Hao Tian , Xingyu Zeng , Rui Zhao , Jifeng Dai , Hongsheng Li , Xihui Liu

End-to-end optimization has achieved state-of-the-art performance on many specific problems, but there is no straight-forward way to combine pretrained models for new problems. Here, we explore improving modularity by learning a post-hoc…

Machine Learning · Computer Science 2019-02-25 Yingtao Tian , Jesse Engel

With the advancement of language models, unified multimodal understanding and generation have made significant strides, with model architectures evolving from separated components to unified single-model frameworks. This paper explores an…

Computer Vision and Pattern Recognition · Computer Science 2025-06-04 Yicheng Xiao , Lin Song , Rui Yang , Cheng Cheng , Zunnan Xu , Zhaoyang Zhang , Yixiao Ge , Xiu Li , Ying Shan

Existing multimodal generative models fall short as qualified design copilots, as they often struggle to generate imaginative outputs once instructions are less detailed or lack the ability to maintain consistency with the provided…

Computer Vision and Pattern Recognition · Computer Science 2025-03-11 Zhipeng Huang , Shaobin Zhuang , Canmiao Fu , Binxin Yang , Ying Zhang , Chong Sun , Zhizheng Zhang , Yali Wang , Chen Li , Zheng-Jun Zha