English
Related papers

Related papers: Lance: Unified Multimodal Modeling by Multi-Task S…

200 papers

We present Unified-IO 2, the first autoregressive multimodal model that is capable of understanding and generating image, text, audio, and action. To unify different modalities, we tokenize inputs and outputs -- images, text, audio, action,…

Computer Vision and Pattern Recognition · Computer Science 2023-12-29 Jiasen Lu , Christopher Clark , Sangho Lee , Zichen Zhang , Savya Khosla , Ryan Marten , Derek Hoiem , Aniruddha Kembhavi

Multimodal pretraining is an effective strategy for the trinity of goals of representation learning in autonomous robots: 1) extracting both local and global task progressions; 2) enforcing temporal consistency of visual representation; 3)…

Empowering Large Multimodal Models (LMMs) with image generation often leads to catastrophic forgetting in understanding tasks due to severe gradient conflicts. While existing paradigms like Mixture-of-Transformers (MoT) mitigate this…

Computer Vision and Pattern Recognition · Computer Science 2026-04-10 Xiangyue Liu , Zijian Zhang , Miles Yang , Zhao Zhong , Liefeng Bo , Ping Tan

Unified multimodal models that couple visual understanding with image generation have advanced rapidly, yet most systems still focus on visual grounding-aligning language with image regions-while their generative counterpart,…

Computer Vision and Pattern Recognition · Computer Science 2026-03-17 Xuanke Shi , Boxuan Li , Xiaoyang Han , Zhongang Cai , Lei Yang , Quan Wang , Dahua Lin

In this report, we introduce ERNIE 5.0, a natively autoregressive foundation model desinged for unified multimodal understanding and generation across text, image, video, and audio. All modalities are trained from scratch under a unified…

Computation and Language · Computer Science 2026-02-05 Haifeng Wang , Hua Wu , Tian Wu , Yu Sun , Jing Liu , Dianhai Yu , Yanjun Ma , Jingzhou He , Zhongjun He , Dou Hong , Qiwen Liu , Shuohuan Wang , Junyuan Shang , Zhenyu Zhang , Yuchen Ding , Jinle Zeng , Jiabin Yang , Liang Shen , Ruibiao Chen , Weichong Yin , Siyu Ding , Dai Dai , Shikun Feng , Siqi Bao , Bolei He , Yan Chen , Zhenyu Jiao , Ruiqing Zhang , Zeyu Chen , Qingqing Dang , Kaipeng Deng , Jiajun Jiang , Enlei Gong , Guoxia Wang , Yanlin Sha , Yi Liu , Yehan Zheng , Weijian Xu , Jiaxiang Liu , Zengfeng Zeng , Yingqi Qu , Zhongli Li , Zhengkun Zhang , Xiyang Wang , Zixiang Xu , Xinchao Xu , Zhengjie Huang , Dong Wang , Bingjin Chen , Yue Chang , Xing Yuan , Shiwei Huang , Qiao Zhao , Xinzhe Ding , Shuangshuang Qiao , Baoshan Yang , Bihong Tang , Bin Li , Bingquan Wang , Binhan Tang , Binxiong Zheng , Bo Cui , Bo Ke , Bo Zhang , Bowen Zhang , Boyan Zhang , Boyang Liu , Caiji Zhang , Can Li , Chang Xu , Chao Pang , Chao Zhang , Chaoyi Yuan , Chen Chen , Cheng Cui , Chenlin Yin , Chun Gan , Chunguang Chai , Chuyu Fang , Cuiyun Han , Dan Zhang , Danlei Feng , Danxiang Zhu , Dong Sun , Dongbo Li , Dongdong Li , Dongdong Liu , Dongxue Liu , Fan Ding , Fan Hu , Fan Li , Fan Mo , Feisheng Wu , Fengwei Liu , Gangqiang Hu , Gaofeng Lu , Gaopeng Yong , Gexiao Tian , Guan Wang , Guangchen Ni , Guangshuo Wu , Guanzhong Wang , Guihua Liu , Guishun Li , Haibin Li , Haijian Liang , Haipeng Ming , Haisu Wang , Haiyang Lu , Haiye Lin , Han Zhou , Hangting Lou , Hanwen Du , Hanzhi Zhang , Hao Chen , Hao Du , Hao Liu , Hao Zhou , Haochen Jiang , Haodong Tian , Haoshuang Wang , Haozhe Geng , Heju Yin , Hong Chen , Hongchen Xue , Hongen Liu , Honggeng Zhang , Hongji Xu , Hongwei Chen , Hongyang Zhang , Hongyuan Zhang , Hua Lu , Huan Chen , Huan Wang , Huang He , Hui Liu , Hui Zhong , Huibin Ruan , Jiafeng Lu , Jiage Liang , Jiahao Hu , Jiahao Hu , Jiajie Yang , Jialin Li , Jian Chen , Jian Wu , Jianfeng Yang , Jianguang Jiang , Jianhua Wang , Jianye Chen , Jiaodi Liu , Jiarui Zhou , Jiawei Lv , Jiaxin Zhou , Jiaxuan Liu , Jie Han , Jie Sun , Jiefan Fang , Jihan Liu , Jihua Liu , Jing Hu , Jing Qian , Jing Yan , Jingdong Du , Jingdong Wang , Jingjing Wu , Jingyong Li , Jinheng Wang , Jinjin Li , Jinliang Lu , Jinlin Yu , Jinnan Liu , Jixiang Feng , Jiyi Huang , Jiyuan Zhang , Jun Liang , Jun Xia , Jun Yu , Junda Chen , Junhao Feng , Junhong Xiang , Junliang Li , Kai Liu , Kailun Chen , Kairan Su , Kang Hu , Kangkang Zhou , Ke Chen , Ke Wei , Kui Huang , Kun Wu , Kunbin Chen , Lei Han , Lei Sun , Lei Wen , Linghui Meng , Linhao Yu , Liping Ouyang , Liwen Zhang , Longbin Ji , Longzhi Wang , Meng Sun , Meng Tian , Mengfei Li , Mengqi Zeng , Mengyu Zhang , Ming Hong , Mingcheng Zhou , Mingming Huang , Mingxin Chen , Mingzhu Cai , Naibin Gu , Nemin Qiu , Nian Wang , Peng Qiu , Peng Zhao , Pengyu Zou , Qi Wang , Qi Xin , Qian Wang , Qiang Zhu , Qianhui Luo , Qianwei Yang , Qianyue He , Qifei Wu , Qinrui Li , Qiwen Bao , Quan Zhang , Quanxiang Liu , Qunyi Xie , Rongrui Zhan , Rufeng Dai , Rui Peng , Ruian Liu , Ruihao Xu , Ruijie Wang , Ruixi Zhang , Ruixuan Liu , Runsheng Shi , Ruting Wang , Senbo Kang , Shan Lu , Shaofei Yu , Shaotian Gong , Shenwei Hu , Shifeng Zheng , Shihao Guo , Shilong Fan , Shiqin Liu , Shiwei Gu , Shixi Zhang , Shuai Yao , Shuang Zhang , Shuangqiao Liu , Shuhao Liang , Shuwei He , Shuwen Yang , Sijun He , Siming Dai , Siming Wu , Siyi Long , Songhe Deng , Suhui Dong , Suyin Liang , Teng Hu , Tianchan Xu , Tianliang Lv , Tianmeng Yang , Tianyi Wei , Tiezhu Gao , Ting Sun , Ting Zhang , Tingdan Luo , Wei He , Wei Luan , Wei Yin , Wei Zhang , Wei Zhou , Weibao Gong , Weibin Li , Weicheng Huang , Weichong Dang , Weiguo Zhu , Weilong Zhang , Weiqi Tan , Wen Huang , Wenbin Chang , Wenjing Du , Wenlong Miao , Wenpei Luo , Wenquan Wu , Xi Shi , Xi Zhao , Xiang Gao , Xiangguo Zhang , Xiangrui Yu , Xiangsen Wang , Xiangzhe Wang , Xianlong Luo , Xianying Ma , Xiao Tan , Xiaocong Lin , Xiaofei Wang , Xiaofeng Peng , Xiaofeng Wu , Xiaojian Xu , Xiaolan Yuan , Xiaopeng Cui , Xiaotian Han , Xiaoxiong Liu , Xiaoxu Fei , Xiaoxuan Wu , Xiaoyu Wang , Xiaoyu Zhang , Xin Sun , Xin Wang , Xinhui Huang , Xinming Zhu , Xintong Yu , Xinyi Xu , Xinyu Wang , Xiuxian Li , XuanShi Zhu , Xue Xu , Xueying Lv , Xuhong Li , Xulong Wei , Xuyi Chen , Yabing Shi , Yafeng Wang , Yamei Li , Yan Liu , Yanfu Cheng , Yang Gao , Yang Liang , Yang Wang , Yang Wang , Yang Yang , Yanlong Liu , Yannian Fu , Yanpeng Wang , Yanzheng Lin , Yao Chen , Yaozong Shen , Yaqian Han , Yehua Yang , Yekun Chai , Yesong Wang , Yi Song , Yichen Zhang , Yifei Wang , Yifeng Guo , Yifeng Kou , Yilong Chen , Yilong Guo , Yiming Wang , Ying Chen , Ying Wang , Yingsheng Wu , Yingzhan Lin , Yinqi Yang , Yiran Xing , Yishu Lei , Yixiang Tu , Yiyan Chen , Yong Zhang , Yonghua Li , Yongqiang Ma , Yongxing Dai , Yongyue Zhang , Yu Ran , Yu Sun , Yu-Wen Michael Zhang , Yuang Liu , Yuanle Liu , Yuanyuan Zhou , Yubo Zhang , Yuchen Han , Yucheng Wang , Yude Gao , Yuedong Luo , Yuehu Dong , Yufeng Hu , Yuhui Cao , Yuhui Yun , Yukun Chen , Yukun Gao , Yukun Li , Yumeng Zhang , Yun Fan , Yun Ma , Yunfei Zhang , Yunshen Xie , Yuping Xu , Yuqin Zhang , Yuqing Liu , Yurui Li , Yuwen Wang , Yuxiang Lu , Zefeng Cai , Zelin Zhao , Zelun Zhang , Zenan Lin , Zezhao Dong , Zhaowu Pan , Zhaoyu Liu , Zhe Dong , Zhe Zhang , Zhen Zhang , Zhengfan Wu , Zhengrui Wei , Zhengsheng Ning , Zhenxing Li , Zhenyu Li , Zhenyu Qian , Zhenyun Li , Zhi Li , Zhichao Chen , Zhicheng Dong , Zhida Feng , Zhifan Feng , Zhihao Deng , Zhijin Yu , Zhiyang Chen , Zhonghui Zheng , Zhuangzhuang Guo , Zhujun Zhang , Zhuo Sun , Zichang Liu , Zihan Lin , Zihao Huang , Zihe Zhu , Ziheng Zhao , Ziping Chen , Zixuan Zhu , Ziyang Xu , Ziyi Liang , Ziyuan Gao

Despite the success of vision-language models in various generative tasks, obtaining high-quality semantic representations for products and user intents is still challenging due to the inability of off-the-shelf models to capture nuanced…

Information Retrieval · Computer Science 2025-11-07 Omkar Gurjar , Kin Sum Liu , Praveen Kolli , Utsaw Kumar , Mandar Rahurkar

Federated learning (FL) has become a promising paradigm for collaborative medical image analysis, yet existing frameworks remain tightly coupled to task-specific backbones and are fragile under heterogeneous imaging modalities. Such…

Computer Vision and Pattern Recognition · Computer Science 2026-03-24 Meilin Liu , Jiaying Wang , Jing Shan

Existing text-to-image diffusion models have demonstrated remarkable capabilities in generating high-quality images guided by textual prompts. However, achieving multi-subject compositional synthesis with precise spatial control remains a…

Computer Vision and Pattern Recognition · Computer Science 2025-08-21 Fei Peng , Junqiang Wu , Yan Li , Tingting Gao , Di Zhang , Huiyuan Fu

Multimodal language models (MLMs) integrate visual and textual information by coupling a vision encoder with a large language model through the specific adapter. While existing approaches commonly rely on a single pre-trained vision…

Computer Vision and Pattern Recognition · Computer Science 2025-02-24 Matvey Skripkin , Elizaveta Goncharova , Dmitrii Tarasov , Andrey Kuznetsov

Most existing vision-language pre-training methods focus on understanding tasks and use BERT-like objectives (masked language modeling and image-text matching) during pretraining. Although they perform well in many understanding downstream…

Computer Vision and Pattern Recognition · Computer Science 2021-12-16 Tianyi Liu , Zuxuan Wu , Wenhan Xiong , Jingjing Chen , Yu-Gang Jiang

This paper introduces the M&M model, a novel multimodal-multitask learning framework, applied to the AVCAffe dataset for cognitive load assessment (CLA). M&M uniquely integrates audiovisual cues through a dual-pathway architecture,…

Computer Vision and Pattern Recognition · Computer Science 2024-03-15 Long Nguyen-Phuoc , Renald Gaboriau , Dimitri Delacroix , Laurent Navarro

A fundamental challenge in federated learning lies in mixing heterogeneous datasets and classification tasks while minimizing the high communication cost caused by clients as well as the exchange of weight updates with the server over a…

Image and Video Processing · Electrical Eng. & Systems 2024-08-19 Atefe Hassani , Islem Rekik

In recent times, Vision-Language Models (VLMs) have been trained under two predominant paradigms. Generative training has enabled Multimodal Large Language Models (MLLMs) to tackle various complex tasks, yet issues such as hallucinations…

Computer Vision and Pattern Recognition · Computer Science 2024-11-04 Wei Chow , Juncheng Li , Qifan Yu , Kaihang Pan , Hao Fei , Zhiqi Ge , Shuai Yang , Siliang Tang , Hanwang Zhang , Qianru Sun

Multi-modal learning has made significant advances across diverse pattern recognition applications. However, handling missing modalities, especially under imbalanced missing rates, remains a major challenge. This imbalance triggers a…

Computer Vision and Pattern Recognition · Computer Science 2025-11-11 Binyu Zhao , Wei Zhang , Zhaonian Zou

Recent progress in diffusion models significantly advances various image generation tasks. However, the current mainstream approach remains focused on building task-specific models, which have limited efficiency when supporting a wide range…

Computer Vision and Pattern Recognition · Computer Science 2026-01-08 Zhong-Yu Li , Ruoyi Du , Juncheng Yan , Le Zhuo , Qilong Wu , Zhen Li , Peng Gao , Zhanyu Ma , Ming-Ming Cheng

This paper presents a unified approach to understanding dynamic scenes from casual videos. Large pretrained vision foundation models, such as vision-language, video depth prediction, motion tracking, and segmentation models, offer promising…

Computer Vision and Pattern Recognition · Computer Science 2025-03-28 David Yifan Yao , Albert J. Zhai , Shenlong Wang

Majority of research in learning based methods has been towards designing and training networks for specific tasks. However, many of the learning based tasks, across modalities, share commonalities and could be potentially tackled in a…

Computer Vision and Pattern Recognition · Computer Science 2023-11-13 Siddharth Srivastava , Gaurav Sharma

While modern diffusion models excel at generating high-quality and diverse images, they still struggle with high-fidelity compositional and multimodal control, particularly when users simultaneously specify text prompts, subject references,…

Computer Vision and Pattern Recognition · Computer Science 2025-11-27 Yusuf Dalva , Guocheng Gordon Qian , Maya Goldenberg , Tsai-Shien Chen , Kfir Aberman , Sergey Tulyakov , Pinar Yanardag , Kuan-Chieh Jackson Wang

Multimodal language models now integrate text, audio, and video for unified reasoning. Yet existing RL post-training pipelines treat all input signals as equally relevant, ignoring which modalities each task actually requires. This…

Artificial Intelligence · Computer Science 2026-02-13 Nikhil Verma , Minjung Kim , JooYoung Yoo , Kyung-Min Jin , Manasa Bharadwaj , Kevin Ferreira , Ko Keun Kim , Youngjoon Kim

Efficiently transferring Learned Image Compression (LIC) model from human perception to machine perception is an emerging challenge in vision-centric representation learning. Existing approaches typically adapt LIC to downstream tasks in a…

Computer Vision and Pattern Recognition · Computer Science 2025-08-05 Jiancheng Zhao , Xiang Ji , Yinqiang Zheng