English
Related papers

Related papers: ERNIE-ViL 2.0: Multi-view Contrastive Learning for…

200 papers

Software engineers working with the same programming language (PL) may speak different natural languages (NLs) and vice versa, erecting huge barriers to communication and working efficiency. Recent studies have demonstrated the…

Computation and Language · Computer Science 2023-05-22 Yekun Chai , Shuohuan Wang , Chao Pang , Yu Sun , Hao Tian , Hua Wu

The Contrastive Language-Image Pre-training (CLIP) framework has become a widely used approach for multimodal representation learning, particularly in image-text retrieval and clustering. However, its efficacy is constrained by three key…

Computer Vision and Pattern Recognition · Computer Science 2025-12-09 Tiancheng Gu , Kaicheng Yang , Ziyong Feng , Xingjun Wang , Yanzhao Zhang , Dingkun Long , Yingda Chen , Weidong Cai , Jiankang Deng

Contrastive Language-Image Pretraining (CLIP) has achieved remarkable success, leading to rapid advancements in multimodal studies. However, CLIP faces a notable challenge in terms of inefficient data utilization. It relies on a single…

Computer Vision and Pattern Recognition · Computer Science 2024-06-05 Yu Zhang , Qi Zhang , Zixuan Gong , Yiwei Shi , Yepeng Liu , Duoqian Miao , Yang Liu , Ke Liu , Kun Yi , Wei Fan , Liang Hu , Changwei Wang

Weakly supervised vision-and-language pre-training (WVLP), which learns cross-modal representations with limited cross-modal supervision, has been shown to effectively reduce the data cost of pre-training while maintaining decent…

Computer Vision and Pattern Recognition · Computer Science 2023-05-26 Chi Chen , Peng Li , Maosong Sun , Yang Liu

With the flourishing of social media platforms, vision-language pre-training (VLP) recently has received great attention and many remarkable progresses have been achieved. The success of VLP largely benefits from the information…

Computer Vision and Pattern Recognition · Computer Science 2024-10-17 Zhiyuan Ma , Jianjun Li , Guohui Li , Kaiyan Huang

As data requirements continue to grow, efficient learning increasingly depends on the curation and distillation of high-value data rather than brute-force scaling of model sizes. In the case of a hyperspectral image (HSI), the challenge is…

Computer Vision and Pattern Recognition · Computer Science 2025-09-30 Abhiroop Chatterjee , Susmita Ghosh

In this report, we introduce ERNIE 5.0, a natively autoregressive foundation model desinged for unified multimodal understanding and generation across text, image, video, and audio. All modalities are trained from scratch under a unified…

Computation and Language · Computer Science 2026-02-05 Haifeng Wang , Hua Wu , Tian Wu , Yu Sun , Jing Liu , Dianhai Yu , Yanjun Ma , Jingzhou He , Zhongjun He , Dou Hong , Qiwen Liu , Shuohuan Wang , Junyuan Shang , Zhenyu Zhang , Yuchen Ding , Jinle Zeng , Jiabin Yang , Liang Shen , Ruibiao Chen , Weichong Yin , Siyu Ding , Dai Dai , Shikun Feng , Siqi Bao , Bolei He , Yan Chen , Zhenyu Jiao , Ruiqing Zhang , Zeyu Chen , Qingqing Dang , Kaipeng Deng , Jiajun Jiang , Enlei Gong , Guoxia Wang , Yanlin Sha , Yi Liu , Yehan Zheng , Weijian Xu , Jiaxiang Liu , Zengfeng Zeng , Yingqi Qu , Zhongli Li , Zhengkun Zhang , Xiyang Wang , Zixiang Xu , Xinchao Xu , Zhengjie Huang , Dong Wang , Bingjin Chen , Yue Chang , Xing Yuan , Shiwei Huang , Qiao Zhao , Xinzhe Ding , Shuangshuang Qiao , Baoshan Yang , Bihong Tang , Bin Li , Bingquan Wang , Binhan Tang , Binxiong Zheng , Bo Cui , Bo Ke , Bo Zhang , Bowen Zhang , Boyan Zhang , Boyang Liu , Caiji Zhang , Can Li , Chang Xu , Chao Pang , Chao Zhang , Chaoyi Yuan , Chen Chen , Cheng Cui , Chenlin Yin , Chun Gan , Chunguang Chai , Chuyu Fang , Cuiyun Han , Dan Zhang , Danlei Feng , Danxiang Zhu , Dong Sun , Dongbo Li , Dongdong Li , Dongdong Liu , Dongxue Liu , Fan Ding , Fan Hu , Fan Li , Fan Mo , Feisheng Wu , Fengwei Liu , Gangqiang Hu , Gaofeng Lu , Gaopeng Yong , Gexiao Tian , Guan Wang , Guangchen Ni , Guangshuo Wu , Guanzhong Wang , Guihua Liu , Guishun Li , Haibin Li , Haijian Liang , Haipeng Ming , Haisu Wang , Haiyang Lu , Haiye Lin , Han Zhou , Hangting Lou , Hanwen Du , Hanzhi Zhang , Hao Chen , Hao Du , Hao Liu , Hao Zhou , Haochen Jiang , Haodong Tian , Haoshuang Wang , Haozhe Geng , Heju Yin , Hong Chen , Hongchen Xue , Hongen Liu , Honggeng Zhang , Hongji Xu , Hongwei Chen , Hongyang Zhang , Hongyuan Zhang , Hua Lu , Huan Chen , Huan Wang , Huang He , Hui Liu , Hui Zhong , Huibin Ruan , Jiafeng Lu , Jiage Liang , Jiahao Hu , Jiahao Hu , Jiajie Yang , Jialin Li , Jian Chen , Jian Wu , Jianfeng Yang , Jianguang Jiang , Jianhua Wang , Jianye Chen , Jiaodi Liu , Jiarui Zhou , Jiawei Lv , Jiaxin Zhou , Jiaxuan Liu , Jie Han , Jie Sun , Jiefan Fang , Jihan Liu , Jihua Liu , Jing Hu , Jing Qian , Jing Yan , Jingdong Du , Jingdong Wang , Jingjing Wu , Jingyong Li , Jinheng Wang , Jinjin Li , Jinliang Lu , Jinlin Yu , Jinnan Liu , Jixiang Feng , Jiyi Huang , Jiyuan Zhang , Jun Liang , Jun Xia , Jun Yu , Junda Chen , Junhao Feng , Junhong Xiang , Junliang Li , Kai Liu , Kailun Chen , Kairan Su , Kang Hu , Kangkang Zhou , Ke Chen , Ke Wei , Kui Huang , Kun Wu , Kunbin Chen , Lei Han , Lei Sun , Lei Wen , Linghui Meng , Linhao Yu , Liping Ouyang , Liwen Zhang , Longbin Ji , Longzhi Wang , Meng Sun , Meng Tian , Mengfei Li , Mengqi Zeng , Mengyu Zhang , Ming Hong , Mingcheng Zhou , Mingming Huang , Mingxin Chen , Mingzhu Cai , Naibin Gu , Nemin Qiu , Nian Wang , Peng Qiu , Peng Zhao , Pengyu Zou , Qi Wang , Qi Xin , Qian Wang , Qiang Zhu , Qianhui Luo , Qianwei Yang , Qianyue He , Qifei Wu , Qinrui Li , Qiwen Bao , Quan Zhang , Quanxiang Liu , Qunyi Xie , Rongrui Zhan , Rufeng Dai , Rui Peng , Ruian Liu , Ruihao Xu , Ruijie Wang , Ruixi Zhang , Ruixuan Liu , Runsheng Shi , Ruting Wang , Senbo Kang , Shan Lu , Shaofei Yu , Shaotian Gong , Shenwei Hu , Shifeng Zheng , Shihao Guo , Shilong Fan , Shiqin Liu , Shiwei Gu , Shixi Zhang , Shuai Yao , Shuang Zhang , Shuangqiao Liu , Shuhao Liang , Shuwei He , Shuwen Yang , Sijun He , Siming Dai , Siming Wu , Siyi Long , Songhe Deng , Suhui Dong , Suyin Liang , Teng Hu , Tianchan Xu , Tianliang Lv , Tianmeng Yang , Tianyi Wei , Tiezhu Gao , Ting Sun , Ting Zhang , Tingdan Luo , Wei He , Wei Luan , Wei Yin , Wei Zhang , Wei Zhou , Weibao Gong , Weibin Li , Weicheng Huang , Weichong Dang , Weiguo Zhu , Weilong Zhang , Weiqi Tan , Wen Huang , Wenbin Chang , Wenjing Du , Wenlong Miao , Wenpei Luo , Wenquan Wu , Xi Shi , Xi Zhao , Xiang Gao , Xiangguo Zhang , Xiangrui Yu , Xiangsen Wang , Xiangzhe Wang , Xianlong Luo , Xianying Ma , Xiao Tan , Xiaocong Lin , Xiaofei Wang , Xiaofeng Peng , Xiaofeng Wu , Xiaojian Xu , Xiaolan Yuan , Xiaopeng Cui , Xiaotian Han , Xiaoxiong Liu , Xiaoxu Fei , Xiaoxuan Wu , Xiaoyu Wang , Xiaoyu Zhang , Xin Sun , Xin Wang , Xinhui Huang , Xinming Zhu , Xintong Yu , Xinyi Xu , Xinyu Wang , Xiuxian Li , XuanShi Zhu , Xue Xu , Xueying Lv , Xuhong Li , Xulong Wei , Xuyi Chen , Yabing Shi , Yafeng Wang , Yamei Li , Yan Liu , Yanfu Cheng , Yang Gao , Yang Liang , Yang Wang , Yang Wang , Yang Yang , Yanlong Liu , Yannian Fu , Yanpeng Wang , Yanzheng Lin , Yao Chen , Yaozong Shen , Yaqian Han , Yehua Yang , Yekun Chai , Yesong Wang , Yi Song , Yichen Zhang , Yifei Wang , Yifeng Guo , Yifeng Kou , Yilong Chen , Yilong Guo , Yiming Wang , Ying Chen , Ying Wang , Yingsheng Wu , Yingzhan Lin , Yinqi Yang , Yiran Xing , Yishu Lei , Yixiang Tu , Yiyan Chen , Yong Zhang , Yonghua Li , Yongqiang Ma , Yongxing Dai , Yongyue Zhang , Yu Ran , Yu Sun , Yu-Wen Michael Zhang , Yuang Liu , Yuanle Liu , Yuanyuan Zhou , Yubo Zhang , Yuchen Han , Yucheng Wang , Yude Gao , Yuedong Luo , Yuehu Dong , Yufeng Hu , Yuhui Cao , Yuhui Yun , Yukun Chen , Yukun Gao , Yukun Li , Yumeng Zhang , Yun Fan , Yun Ma , Yunfei Zhang , Yunshen Xie , Yuping Xu , Yuqin Zhang , Yuqing Liu , Yurui Li , Yuwen Wang , Yuxiang Lu , Zefeng Cai , Zelin Zhao , Zelun Zhang , Zenan Lin , Zezhao Dong , Zhaowu Pan , Zhaoyu Liu , Zhe Dong , Zhe Zhang , Zhen Zhang , Zhengfan Wu , Zhengrui Wei , Zhengsheng Ning , Zhenxing Li , Zhenyu Li , Zhenyu Qian , Zhenyun Li , Zhi Li , Zhichao Chen , Zhicheng Dong , Zhida Feng , Zhifan Feng , Zhihao Deng , Zhijin Yu , Zhiyang Chen , Zhonghui Zheng , Zhuangzhuang Guo , Zhujun Zhang , Zhuo Sun , Zichang Liu , Zihan Lin , Zihao Huang , Zihe Zhu , Ziheng Zhao , Ziping Chen , Zixuan Zhu , Ziyang Xu , Ziyi Liang , Ziyuan Gao

Pre-training of text and layout has proved effective in a variety of visually-rich document understanding tasks due to its effective model architecture and the advantage of large-scale unlabeled scanned/digital-born documents. We propose…

Computation and Language · Computer Science 2022-01-11 Yang Xu , Yiheng Xu , Tengchao Lv , Lei Cui , Furu Wei , Guoxin Wang , Yijuan Lu , Dinei Florencio , Cha Zhang , Wanxiang Che , Min Zhang , Lidong Zhou

Contrastive Language-Image Pre-training (CLIP) has been a celebrated method for training vision encoders to generate image/text representations facilitating various applications. Recently, CLIP has been widely adopted as the vision backbone…

Computer Vision and Pattern Recognition · Computer Science 2025-02-20 Hong-You Chen , Zhengfeng Lai , Haotian Zhang , Xinze Wang , Marcin Eichner , Keen You , Meng Cao , Bowen Zhang , Yinfei Yang , Zhe Gan

Training models to apply common-sense linguistic knowledge and visual concepts from 2D images to 3D scene understanding is a promising direction that researchers have only recently started to explore. However, it still remains understudied…

Computer Vision and Pattern Recognition · Computer Science 2023-06-12 Alexandros Delitzas , Maria Parelli , Nikolas Hars , Georgios Vlassis , Sotirios Anagnostidis , Gregor Bachmann , Thomas Hofmann

Cross-modal contrastive learning in vision language pretraining (VLP) faces the challenge of (partial) false negatives. In this paper, we study this problem from the perspective of Mutual Information (MI) optimization. It is common sense…

Computation and Language · Computer Science 2024-02-27 Chaoya Jiang , Rui Xie , Wei Ye , Jinan Sun , Shikun Zhang

Contrastive cross-modal models such as CLIP and CLAP aid various vision-language (VL) and audio-language (AL) tasks. However, there has been limited investigation of and improvement in their language encoder, which is the central component…

Computation and Language · Computer Science 2023-10-23 Mengjie Zhao , Junya Ono , Zhi Zhong , Chieh-Hsin Lai , Yuhta Takida , Naoki Murata , Wei-Hsiang Liao , Takashi Shibuya , Hiromi Wakaki , Yuki Mitsufuji

Recent advances in vision-language pre-training have pushed the state-of-the-art on various vision-language tasks, making machines more capable of multi-modal writing (image-to-text generation) and painting (text-to-image generation).…

Computer Vision and Pattern Recognition · Computer Science 2023-02-20 Shizhe Diao , Wangchunshu Zhou , Xinsong Zhang , Jiawei Wang

Self-supervised vision-and-language pretraining (VLP) aims to learn transferable multi-modal representations from large-scale image-text data and to achieve strong performances on a broad scope of vision-language tasks after finetuning.…

Computer Vision and Pattern Recognition · Computer Science 2022-08-09 Yongfei Liu , Chenfei Wu , Shao-yen Tseng , Vasudev Lal , Xuming He , Nan Duan

Many self-supervised learning methods are pre-trained on the well-curated ImageNet-1K dataset. In this work, given the excellent scalability of web data, we consider self-supervised pre-training on noisy web sourced image-text paired data.…

Computer Vision and Pattern Recognition · Computer Science 2024-08-06 Bingchen Zhao , Quan Cui , Hao Wu , Osamu Yoshie , Cheng Yang , Oisin Mac Aodha

Several multi-modality representation learning approaches such as LXMERT and ViLBERT have been proposed recently. Such approaches can achieve superior performance due to the high-level semantic information captured during large-scale…

Computer Vision and Pattern Recognition · Computer Science 2020-07-28 Lei Shi , Kai Shuang , Shijie Geng , Peng Su , Zhengkai Jiang , Peng Gao , Zuohui Fu , Gerard de Melo , Sen Su

Various state-of-the-art self-supervised visual representation learning approaches take advantage of data from multiple sensors by aligning the feature representations across views and/or modalities. In this work, we investigate how…

Computer Vision and Pattern Recognition · Computer Science 2022-11-28 Thomas M. Hehn , Julian F. P. Kooij , Dariu M. Gavrila

Vision-and-language pre-training has achieved impressive success in learning multimodal representations between vision and language. To generalize this success to non-English languages, we introduce UC2, the first machine…

Computer Vision and Pattern Recognition · Computer Science 2021-04-02 Mingyang Zhou , Luowei Zhou , Shuohang Wang , Yu Cheng , Linjie Li , Zhou Yu , Jingjing Liu

Vision language pre-training aims to learn alignments between vision and language from a large amount of data. Most existing methods only learn image-text alignments. Some others utilize pre-trained object detectors to leverage vision…

Computer Vision and Pattern Recognition · Computer Science 2023-08-01 Yan Zeng , Xinsong Zhang , Hang Li , Jiawei Wang , Jipeng Zhang , Wangchunshu Zhou

Contrastive learning has revolutionized the field of computer vision, learning rich representations from unlabeled data, which generalize well to diverse vision tasks. Consequently, it has become increasingly important to explain these…

Computer Vision and Pattern Recognition · Computer Science 2023-12-15 Fawaz Sammani , Boris Joukovsky , Nikos Deligiannis