English
Related papers

Related papers: Flash-Unified: A Training-Free and Task-Aware Acce…

200 papers

Vision-language-action (VLA) models aim to understand natural language instructions and visual observations and to execute corresponding actions as an embodied agent. Recent work integrates future images into the understanding-acting loop,…

Robotics · Computer Science 2026-03-26 Jiayi Chen , Wenxuan Song , Pengxiang Ding , Ziyang Zhou , Han Zhao , Feilong Tang , Donglin Wang , Haoang Li

Natural Language Explanations (NLE) aim at supplementing the prediction of a model with human-friendly natural text. Existing NLE approaches involve training separate models for each downstream task. In this work, we propose Uni-NLX, a…

Computer Vision and Pattern Recognition · Computer Science 2023-09-20 Fawaz Sammani , Nikos Deligiannis

Language and vision-language models have shown impressive performance across a wide range of tasks, but their internal mechanisms remain only partly understood. In this work, we study how individual attention heads in text-generative models…

Computer Vision and Pattern Recognition · Computer Science 2026-01-15 Lorenzo Basile , Valentino Maiorca , Diego Doimo , Francesco Locatello , Alberto Cazzaniga

For a responsible and safe deployment of diffusion models in various domains, regulating the generated outputs from these models is desirable because such models could generate undesired, violent, and obscene outputs. To tackle this…

Machine Learning · Computer Science 2026-03-24 Subhodip Panda , Varun M S , Shreyans Jain , Sarthak Kumar Maharana , Prathosh A. P

Traditional vision-based autonomous driving systems often face difficulties in navigating complex environments when relying solely on single-image inputs. To overcome this limitation, incorporating temporal data such as past image frames or…

Computer Vision and Pattern Recognition · Computer Science 2025-07-01 Tuong Do , Binh X. Nguyen , Quang D. Tran , Erman Tjiputra , Te-Chuan Chiu , Anh Nguyen

Achieving state-of-the-art performance on natural language understanding tasks typically relies on fine-tuning a fresh model for every task. Consequently, this approach leads to a higher overall parameter cost, along with higher technical…

Computation and Language · Computer Science 2020-07-14 Yi Tay , Zhe Zhao , Dara Bahri , Donald Metzler , Da-Cheng Juan

As large-scale pre-trained foundation models continue to expand in size and capability, efficiently adapting them to specific downstream tasks has become increasingly critical. Despite substantial progress, existing adaptation approaches…

Machine Learning · Computer Science 2025-10-21 Zesheng Ye , Chengyi Cai , Ruijiang Dong , Jianzhong Qi , Lei Feng , Pin-Yu Chen , Feng Liu

Task embedding, a meta-learning technique that captures task-specific information, has gained popularity, especially in areas such as multi-task learning, model editing, and interpretability. However, it faces challenges with the emergence…

Computation and Language · Computer Science 2024-07-15 Xinyu Wang , Hainiu Xu , Lin Gui , Yulan He

Unsupervised domain adaptation (UDA) enables models trained on a labeled source domain to handle new unlabeled domains. Recently, pre-trained vision-language models (VLMs) have demonstrated promising zero-shot performance by leveraging…

Computer Vision and Pattern Recognition · Computer Science 2025-08-08 Xinyao Li , Jingjing Li , Zhekai Du , Lei Zhu , Heng Tao Shen

The superior performance of modern deep networks usually comes with a costly training procedure. This paper presents a new curriculum learning approach for the efficient training of visual backbones (e.g., vision Transformers). Our work is…

Computer Vision and Pattern Recognition · Computer Science 2023-08-17 Yulin Wang , Yang Yue , Rui Lu , Tianjiao Liu , Zhao Zhong , Shiji Song , Gao Huang

The deployment of large-scale models, such as large language models (LLMs) and sophisticated image generation systems, incurs substantial costs due to their computational demands. To mitigate these costs and address challenges related to…

Machine Learning · Computer Science 2024-10-30 Yuzhe Yang , Yipeng Du , Ahmad Farhan , Claudio Angione , Yue Zhao , Harry Yang , Fielding Johnston , James Buban , Patrick Colangelo

Federated learning (FL) has emerged as a key paradigm for collaborative model training across multiple clients without sharing raw data, enabling privacy-preserving applications in areas such as radiology and pathology. However, works on…

Machine Learning · Computer Science 2025-10-31 Furkan Pala , Islem Rekik

Scene understanding, defined as learning, extraction, and representation of interactions among traffic elements, is one of the critical challenges toward high-level autonomous driving (AD). Current scene understanding methods mainly focus…

Computer Vision and Pattern Recognition · Computer Science 2025-04-28 Yuning Wang , Zhiyuan Liu , Haotian Lin , Junkai Jiang , Shaobing Xu , Jianqiang Wang

Large-scale vision-language pre-trained models have shown promising transferability to various downstream tasks. As the size of these foundation models and the number of downstream tasks grow, the standard full fine-tuning paradigm becomes…

Computer Vision and Pattern Recognition · Computer Science 2023-05-23 Haoyu Lu , Yuqi Huo , Guoxing Yang , Zhiwu Lu , Wei Zhan , Masayoshi Tomizuka , Mingyu Ding

Vision-Language Models(VLMs) excel at autoregressive text generation, yet end-to-end autonomous driving requires multi-task learning with structured outputs and heterogeneous decoding behaviors, such as autoregressive language generation,…

Computer Vision and Pattern Recognition · Computer Science 2026-04-21 Yiwei Zhang , Xuesong Chen , Jin Gao , Hanshi Wang , Fudong Ge , Weiming Hu , Shaoshuai Shi , Zhipeng Zhang

In this report, we introduce ERNIE 5.0, a natively autoregressive foundation model desinged for unified multimodal understanding and generation across text, image, video, and audio. All modalities are trained from scratch under a unified…

Computation and Language · Computer Science 2026-02-05 Haifeng Wang , Hua Wu , Tian Wu , Yu Sun , Jing Liu , Dianhai Yu , Yanjun Ma , Jingzhou He , Zhongjun He , Dou Hong , Qiwen Liu , Shuohuan Wang , Junyuan Shang , Zhenyu Zhang , Yuchen Ding , Jinle Zeng , Jiabin Yang , Liang Shen , Ruibiao Chen , Weichong Yin , Siyu Ding , Dai Dai , Shikun Feng , Siqi Bao , Bolei He , Yan Chen , Zhenyu Jiao , Ruiqing Zhang , Zeyu Chen , Qingqing Dang , Kaipeng Deng , Jiajun Jiang , Enlei Gong , Guoxia Wang , Yanlin Sha , Yi Liu , Yehan Zheng , Weijian Xu , Jiaxiang Liu , Zengfeng Zeng , Yingqi Qu , Zhongli Li , Zhengkun Zhang , Xiyang Wang , Zixiang Xu , Xinchao Xu , Zhengjie Huang , Dong Wang , Bingjin Chen , Yue Chang , Xing Yuan , Shiwei Huang , Qiao Zhao , Xinzhe Ding , Shuangshuang Qiao , Baoshan Yang , Bihong Tang , Bin Li , Bingquan Wang , Binhan Tang , Binxiong Zheng , Bo Cui , Bo Ke , Bo Zhang , Bowen Zhang , Boyan Zhang , Boyang Liu , Caiji Zhang , Can Li , Chang Xu , Chao Pang , Chao Zhang , Chaoyi Yuan , Chen Chen , Cheng Cui , Chenlin Yin , Chun Gan , Chunguang Chai , Chuyu Fang , Cuiyun Han , Dan Zhang , Danlei Feng , Danxiang Zhu , Dong Sun , Dongbo Li , Dongdong Li , Dongdong Liu , Dongxue Liu , Fan Ding , Fan Hu , Fan Li , Fan Mo , Feisheng Wu , Fengwei Liu , Gangqiang Hu , Gaofeng Lu , Gaopeng Yong , Gexiao Tian , Guan Wang , Guangchen Ni , Guangshuo Wu , Guanzhong Wang , Guihua Liu , Guishun Li , Haibin Li , Haijian Liang , Haipeng Ming , Haisu Wang , Haiyang Lu , Haiye Lin , Han Zhou , Hangting Lou , Hanwen Du , Hanzhi Zhang , Hao Chen , Hao Du , Hao Liu , Hao Zhou , Haochen Jiang , Haodong Tian , Haoshuang Wang , Haozhe Geng , Heju Yin , Hong Chen , Hongchen Xue , Hongen Liu , Honggeng Zhang , Hongji Xu , Hongwei Chen , Hongyang Zhang , Hongyuan Zhang , Hua Lu , Huan Chen , Huan Wang , Huang He , Hui Liu , Hui Zhong , Huibin Ruan , Jiafeng Lu , Jiage Liang , Jiahao Hu , Jiahao Hu , Jiajie Yang , Jialin Li , Jian Chen , Jian Wu , Jianfeng Yang , Jianguang Jiang , Jianhua Wang , Jianye Chen , Jiaodi Liu , Jiarui Zhou , Jiawei Lv , Jiaxin Zhou , Jiaxuan Liu , Jie Han , Jie Sun , Jiefan Fang , Jihan Liu , Jihua Liu , Jing Hu , Jing Qian , Jing Yan , Jingdong Du , Jingdong Wang , Jingjing Wu , Jingyong Li , Jinheng Wang , Jinjin Li , Jinliang Lu , Jinlin Yu , Jinnan Liu , Jixiang Feng , Jiyi Huang , Jiyuan Zhang , Jun Liang , Jun Xia , Jun Yu , Junda Chen , Junhao Feng , Junhong Xiang , Junliang Li , Kai Liu , Kailun Chen , Kairan Su , Kang Hu , Kangkang Zhou , Ke Chen , Ke Wei , Kui Huang , Kun Wu , Kunbin Chen , Lei Han , Lei Sun , Lei Wen , Linghui Meng , Linhao Yu , Liping Ouyang , Liwen Zhang , Longbin Ji , Longzhi Wang , Meng Sun , Meng Tian , Mengfei Li , Mengqi Zeng , Mengyu Zhang , Ming Hong , Mingcheng Zhou , Mingming Huang , Mingxin Chen , Mingzhu Cai , Naibin Gu , Nemin Qiu , Nian Wang , Peng Qiu , Peng Zhao , Pengyu Zou , Qi Wang , Qi Xin , Qian Wang , Qiang Zhu , Qianhui Luo , Qianwei Yang , Qianyue He , Qifei Wu , Qinrui Li , Qiwen Bao , Quan Zhang , Quanxiang Liu , Qunyi Xie , Rongrui Zhan , Rufeng Dai , Rui Peng , Ruian Liu , Ruihao Xu , Ruijie Wang , Ruixi Zhang , Ruixuan Liu , Runsheng Shi , Ruting Wang , Senbo Kang , Shan Lu , Shaofei Yu , Shaotian Gong , Shenwei Hu , Shifeng Zheng , Shihao Guo , Shilong Fan , Shiqin Liu , Shiwei Gu , Shixi Zhang , Shuai Yao , Shuang Zhang , Shuangqiao Liu , Shuhao Liang , Shuwei He , Shuwen Yang , Sijun He , Siming Dai , Siming Wu , Siyi Long , Songhe Deng , Suhui Dong , Suyin Liang , Teng Hu , Tianchan Xu , Tianliang Lv , Tianmeng Yang , Tianyi Wei , Tiezhu Gao , Ting Sun , Ting Zhang , Tingdan Luo , Wei He , Wei Luan , Wei Yin , Wei Zhang , Wei Zhou , Weibao Gong , Weibin Li , Weicheng Huang , Weichong Dang , Weiguo Zhu , Weilong Zhang , Weiqi Tan , Wen Huang , Wenbin Chang , Wenjing Du , Wenlong Miao , Wenpei Luo , Wenquan Wu , Xi Shi , Xi Zhao , Xiang Gao , Xiangguo Zhang , Xiangrui Yu , Xiangsen Wang , Xiangzhe Wang , Xianlong Luo , Xianying Ma , Xiao Tan , Xiaocong Lin , Xiaofei Wang , Xiaofeng Peng , Xiaofeng Wu , Xiaojian Xu , Xiaolan Yuan , Xiaopeng Cui , Xiaotian Han , Xiaoxiong Liu , Xiaoxu Fei , Xiaoxuan Wu , Xiaoyu Wang , Xiaoyu Zhang , Xin Sun , Xin Wang , Xinhui Huang , Xinming Zhu , Xintong Yu , Xinyi Xu , Xinyu Wang , Xiuxian Li , XuanShi Zhu , Xue Xu , Xueying Lv , Xuhong Li , Xulong Wei , Xuyi Chen , Yabing Shi , Yafeng Wang , Yamei Li , Yan Liu , Yanfu Cheng , Yang Gao , Yang Liang , Yang Wang , Yang Wang , Yang Yang , Yanlong Liu , Yannian Fu , Yanpeng Wang , Yanzheng Lin , Yao Chen , Yaozong Shen , Yaqian Han , Yehua Yang , Yekun Chai , Yesong Wang , Yi Song , Yichen Zhang , Yifei Wang , Yifeng Guo , Yifeng Kou , Yilong Chen , Yilong Guo , Yiming Wang , Ying Chen , Ying Wang , Yingsheng Wu , Yingzhan Lin , Yinqi Yang , Yiran Xing , Yishu Lei , Yixiang Tu , Yiyan Chen , Yong Zhang , Yonghua Li , Yongqiang Ma , Yongxing Dai , Yongyue Zhang , Yu Ran , Yu Sun , Yu-Wen Michael Zhang , Yuang Liu , Yuanle Liu , Yuanyuan Zhou , Yubo Zhang , Yuchen Han , Yucheng Wang , Yude Gao , Yuedong Luo , Yuehu Dong , Yufeng Hu , Yuhui Cao , Yuhui Yun , Yukun Chen , Yukun Gao , Yukun Li , Yumeng Zhang , Yun Fan , Yun Ma , Yunfei Zhang , Yunshen Xie , Yuping Xu , Yuqin Zhang , Yuqing Liu , Yurui Li , Yuwen Wang , Yuxiang Lu , Zefeng Cai , Zelin Zhao , Zelun Zhang , Zenan Lin , Zezhao Dong , Zhaowu Pan , Zhaoyu Liu , Zhe Dong , Zhe Zhang , Zhen Zhang , Zhengfan Wu , Zhengrui Wei , Zhengsheng Ning , Zhenxing Li , Zhenyu Li , Zhenyu Qian , Zhenyun Li , Zhi Li , Zhichao Chen , Zhicheng Dong , Zhida Feng , Zhifan Feng , Zhihao Deng , Zhijin Yu , Zhiyang Chen , Zhonghui Zheng , Zhuangzhuang Guo , Zhujun Zhang , Zhuo Sun , Zichang Liu , Zihan Lin , Zihao Huang , Zihe Zhu , Ziheng Zhao , Ziping Chen , Zixuan Zhu , Ziyang Xu , Ziyi Liang , Ziyuan Gao

Recent advancements in multimodal reward models (RMs) have significantly propelled the development of visual generation. Existing frameworks typically adopt Bradley-Terry-style preference modeling or leverage generative VLMs as judges, and…

Computer Vision and Pattern Recognition · Computer Science 2026-02-11 Yibin Wang , Yuhang Zang , Feng Han , Jiazi Bu , Yujie Zhou , Cheng Jin , Jiaqi Wang

Vision-Language-Action (VLA) models, particularly diffusion-based architectures, demonstrate transformative potential for embodied intelligence but are severely hampered by high computational and memory demands stemming from extensive…

Computer Vision and Pattern Recognition · Computer Science 2025-06-13 Yantai Yang , Yuhao Wang , Zichen Wen , Luo Zhongwei , Chang Zou , Zhipeng Zhang , Chuan Wen , Linfeng Zhang

Recent advances in continuous generative models, including multi-step approaches like diffusion and flow-matching (typically requiring 8-1000 sampling steps) and few-step methods such as consistency models (typically 1-8 steps), have…

Machine Learning · Computer Science 2025-05-21 Peng Sun , Yi Jiang , Tao Lin

One-Shot Neural Architecture Search (NAS) algorithms often rely on training a hardware agnostic super-network for a domain specific task. Optimal sub-networks are then extracted from the trained super-network for different hardware…

Machine Learning · Computer Science 2023-08-31 Sharath Nittur Sridhar , Souvik Kundu , Sairam Sundaresan , Maciej Szankin , Anthony Sarah