English
Related papers

Related papers: NVIDIA Nemotron Nano V2 VL

200 papers

We introduce Nemotron-Nano-9B-v2, a hybrid Mamba-Transformer language model designed to increase throughput for reasoning workloads while achieving state-of-the-art accuracy compared to similarly-sized models. Nemotron-Nano-9B-v2 builds on…

Computation and Language · Computer Science 2025-09-03 NVIDIA , : , Aarti Basant , Abhijit Khairnar , Abhijit Paithankar , Abhinav Khattar , Adithya Renduchintala , Aditya Malte , Akhiad Bercovich , Akshay Hazare , Alejandra Rico , Aleksander Ficek , Alex Kondratenko , Alex Shaposhnikov , Alexander Bukharin , Ali Taghibakhshi , Amelia Barton , Ameya Sunil Mahabaleshwarkar , Amy Shen , Andrew Tao , Ann Guan , Anna Shors , Anubhav Mandarwal , Arham Mehta , Arun Venkatesan , Ashton Sharabiani , Ashwath Aithal , Ashwin Poojary , Ayush Dattagupta , Balaram Buddharaju , Banghua Zhu , Barnaby Simkin , Bilal Kartal , Bita Darvish Rouhani , Bobby Chen , Boris Ginsburg , Brandon Norick , Brian Yu , Bryan Catanzaro , Charles Wang , Charlie Truong , Chetan Mungekar , Chintan Patel , Chris Alexiuk , Christian Munley , Christopher Parisien , Dan Su , Daniel Afrimi , Daniel Korzekwa , Daniel Rohrer , Daria Gitman , David Mosallanezhad , Deepak Narayanan , Dima Rekesh , Dina Yared , Dmytro Pykhtar , Dong Ahn , Duncan Riach , Eileen Long , Elliott Ning , Eric Chung , Erick Galinkin , Evelina Bakhturina , Gargi Prasad , Gerald Shen , Haifeng Qian , Haim Elisha , Harsh Sharma , Hayley Ross , Helen Ngo , Herman Sahota , Hexin Wang , Hoo Chang Shin , Hua Huang , Iain Cunningham , Igor Gitman , Ivan Moshkov , Jaehun Jung , Jan Kautz , Jane Polak Scowcroft , Jared Casper , Jian Zhang , Jiaqi Zeng , Jimmy Zhang , Jinze Xue , Jocelyn Huang , Joey Conway , John Kamalu , Jonathan Cohen , Joseph Jennings , Julien Veron Vialard , Junkeun Yi , Jupinder Parmar , Kari Briski , Katherine Cheung , Katherine Luna , Keith Wyss , Keshav Santhanam , Kezhi Kong , Krzysztof Pawelec , Kumar Anik , Kunlun Li , Kushan Ahmadian , Lawrence McAfee , Laya Sleiman , Leon Derczynski , Luis Vega , Maer Rodrigues de Melo , Makesh Narsimhan Sreedhar , Marcin Chochowski , Mark Cai , Markus Kliegl , Marta Stepniewska-Dziubinska , Matvei Novikov , Mehrzad Samadi , Meredith Price , Meriem Boubdir , Michael Boone , Michael Evans , Michal Bien , Michal Zawalski , Miguel Martinez , Mike Chrzanowski , Mohammad Shoeybi , Mostofa Patwary , Namit Dhameja , Nave Assaf , Negar Habibi , Nidhi Bhatia , Nikki Pope , Nima Tajbakhsh , Nirmal Kumar Juluru , Oleg Rybakov , Oleksii Hrinchuk , Oleksii Kuchaiev , Oluwatobi Olabiyi , Pablo Ribalta , Padmavathy Subramanian , Parth Chadha , Pavlo Molchanov , Peter Dykas , Peter Jin , Piotr Bialecki , Piotr Januszewski , Pradeep Thalasta , Prashant Gaikwad , Prasoon Varshney , Pritam Gundecha , Przemek Tredak , Rabeeh Karimi Mahabadi , Rajen Patel , Ran El-Yaniv , Ranjit Rajan , Ria Cheruvu , Rima Shahbazyan , Ritika Borkar , Ritu Gala , Roger Waleffe , Ruoxi Zhang , Russell J. Hewett , Ryan Prenger , Sahil Jain , Samuel Kriman , Sanjeev Satheesh , Saori Kaji , Sarah Yurick , Saurav Muralidharan , Sean Narenthiran , Seonmyeong Bak , Sepehr Sameni , Seungju Han , Shanmugam Ramasamy , Shaona Ghosh , Sharath Turuvekere Sreenivas , Shelby Thomas , Shizhe Diao , Shreya Gopal , Shrimai Prabhumoye , Shubham Toshniwal , Shuoyang Ding , Siddharth Singh , Siddhartha Jain , Somshubra Majumdar , Soumye Singhal , Stefania Alborghetti , Syeda Nahida Akter , Terry Kong , Tim Moon , Tomasz Hliwiak , Tomer Asida , Tony Wang , Tugrul Konuk , Twinkle Vashishth , Tyler Poon , Udi Karpas , Vahid Noroozi , Venkat Srinivasan , Vijay Korthikanti , Vikram Fugro , Vineeth Kalluru , Vitaly Kurin , Vitaly Lavrukhin , Wasi Uddin Ahmad , Wei Du , Wonmin Byeon , Ximing Lu , Xin Dong , Yashaswi Karnati , Yejin Choi , Yian Zhang , Ying Lin , Yonggan Fu , Yoshi Suhara , Zhen Dong , Zhiyu Li , Zhongbo Zhu , Zijia Chen

We introduce Nemotron 3 Nano Omni, the latest model in the Nemotron multimodal series and the first to natively support audio inputs alongside text, images, and video. Nemotron 3 Nano Omni delivers consistent accuracy improvements over its…

Machine Learning · Computer Science 2026-05-12 NVIDIA , : , Amala Sanjay Deshmukh , Kateryna Chumachenko , Tuomas Rintamaki , Matthieu Le , Tyler Poon , Danial Mohseni Taheri , Ilia Karmanov , Guilin Liu , Jarno Seppanen , Arushi Goel , Mike Ranzinger , Greg Heinrich , Guo Chen , Lukas Voegtle , Philipp Fischer , Timo Roman , Karan Sapra , Collin McCarthy , Shaokun Zhang , Fuxiao Liu , Hanrong Ye , Yi Dong , Mingjie Liu , Yifan Peng , Piotr Zelasko , Zhehuai Chen , Nithin Rao Koluguri , Nune Tadevosyan , Lilit Grigoryan , Ehsan Hosseini Asl , Pritam Biswas , Leili Tavabi , Yuanhang Su , Zhiding Yu , Peter Jin , Alexandre Milesi , Netanel Haber , Yao Xu , Sarah Amiraslani , Nabin Mulepati , Eric Tramel , Jaehun Jung , Ximing Lu , Brandon Cui , Jin Xu , Zhiqi Li , Shihao Wang , Yuanguo Kuang , Shaokun Zhang , Huck Yang , Boyi Li , Hongxu Yin , Song Han , Bilal Kartal , Pavlo Molchanov , Adi Renduchintala , Charles Wang , David Mosallanezhad , Soumye Singhal , Luis Vega , Katherine Cheung , Sreyan Ghosh , Yian Zhang , Alexander Bukharin , Venkat Srinivasan , Johnny Greco , Andre Manoel , Maarten Van Segbroeck , Suseella Panguliri , Rohit Watve , Divyanshu Kakwani , Shubham Pachori , Jeffrey Glick , Radha Sri-Tharan , Aileen Zaman , Khanh Nguyen , Shi Chen , Jiaheng Fang , Qing Miao , Wenfei Zhou , Yu Wang , Zaid Pervaiz Bhat , Varun Praveen , Arihant Jain , Ramanathan Arunachalam , Tomasz Kornuta , Ashton Sharabiani , Amy Shen , Wei Huang , Yi-Fu Wu , Ali Roshan Ghias , Huiying Li , Brian Yu , Nima Tajbakhsh , Chen Cui , Wenwen Gao , Li Ding , Terry Kong , Manoj Kilaru , Anahita Bhiwandiwalla , Marek Wawrzos , Daniel Korzekwa , Pablo Ribalta , Grzegorz Chlebus , Besmira Nushi , Ewa Dobrowolska , Maciej Jakub Mikulski , Kunal Dhawan , Steve Huang , Jagadeesh Balam , Yongqiang Wang , Nikolay Karpov , Valentin Mendelev , George Zelenfroynd , Meline Mkrtchyan , Qing Miao , Omri Almog , Bhavesh Pawar , Rameshwar Shivbhakta , Sudeep Sabnis , Ashrton Sharabiani , Negar Habibi , Geethapriya Venkataramani , Pamela Peng , Prerit Rodney , Serge Panev , Richard Mazzarese , Nicky Liu , Michael Fukuyama , Andrii Skliar , Roger Waleffe , Duncan Riach , Yunheng Zou , Jian Hu , Hao Zhang , Binfeng Xu , Yuhao Yang , Zuhair Ahmed , Alexandre Milesi , Carlo del Mundo , Chad Voegele , Zhiyu Cheng , Nave Assaf , Andrii Skliar , Daniel Afrimi , Natan Bagrov , Ran Zilberstein , Ofri Masad , Eugene Khvedchenia , Natan Bagrov , Borys Tymchenko , Tomer Asida , Daniel Afrimi , Parth Mannan , Victor Cui , Michael Evans , Katherine Luna , Jie Lou , Pinky Xu , Guyue Huang , Negar Habibi , Michael Boone , Pradeep Thalasta , Adeola Adesoba , Dina Yared , Christopher Parisien , Leon Derczynski , Shaona Ghosh , Wes Feely , Micah Schaffer , Radha Sri-Tharan , Jeffrey Glick , Barnaby Simkin , George Zelenfroynd , Tomasz Grzegorzek , Rishabh Garg , Aastha Jhunjhunwala , Sergei Kolchenko , Farzan Memarian , Haran Kumar , Shiv Kumar , Isabel Hulseman , Anjali Shah , Kari Briski , Padmavathy Subramanian , Joey Conway , Udi Karpas , Jane Polak Scowcroft , Annie Surla , Shilpa Ammireddy , Ellie Evans , Jesse Oliver , Tom Balough , Chia-Chih Chen , Sandip Bhaskar , Alejandra Rico , Bardiya Sadeghi , Seph Mard , Katherine Cheung , Meredith Price , Laya Sleiman , Saori Kaji , Wesley Helmholz , Wendy Quan , Michael Lightstone , Jonathan Cohen , Jian Zhang , Oleksii Kuchaiev , Boris Ginsburg , Jan Kautz , Eileen Long , Mohammad Shoeybi , Mostofa Patwary , Oluwatobi Olabiyi , Andrew Tao , Bryan Catanzaro , Udi Karpas

We introduce Nemotron-Parse-1.1, a lightweight document parsing and OCR model that advances the capabilities of its predecessor, Nemoretriever-Parse-1.0. Nemotron-Parse-1.1 delivers improved capabilities across general OCR, markdown…

We present the Qwen2-VL Series, an advanced upgrade of the previous Qwen-VL models that redefines the conventional predetermined-resolution approach in visual processing. Qwen2-VL introduces the Naive Dynamic Resolution mechanism, which…

Computer Vision and Pattern Recognition · Computer Science 2024-10-04 Peng Wang , Shuai Bai , Sinan Tan , Shijie Wang , Zhihao Fan , Jinze Bai , Keqin Chen , Xuejing Liu , Jialin Wang , Wenbin Ge , Yang Fan , Kai Dang , Mengfei Du , Xuancheng Ren , Rui Men , Dayiheng Liu , Chang Zhou , Jingren Zhou , Junyang Lin

We introduce the Nemotron 3 family of models - Nano, Super, and Ultra. These models deliver strong agentic, reasoning, and conversational capabilities. The Nemotron 3 family uses a Mixture-of-Experts hybrid Mamba-Transformer architecture to…

Computation and Language · Computer Science 2025-12-25 NVIDIA , : , Aaron Blakeman , Aaron Grattafiori , Aarti Basant , Abhibha Gupta , Abhinav Khattar , Adi Renduchintala , Aditya Vavre , Akanksha Shukla , Akhiad Bercovich , Aleksander Ficek , Aleksandr Shaposhnikov , Alex Kondratenko , Alexander Bukharin , Alexandre Milesi , Ali Taghibakhshi , Alisa Liu , Amelia Barton , Ameya Sunil Mahabaleshwarkar , Amir Klein , Amit Zuker , Amnon Geifman , Amy Shen , Anahita Bhiwandiwalla , Andrew Tao , Anjulie Agrusa , Ankur Verma , Ann Guan , Anubhav Mandarwal , Arham Mehta , Ashwath Aithal , Ashwin Poojary , Asif Ahamed , Asit Mishra , Asma Kuriparambil Thekkumpate , Ayush Dattagupta , Banghua Zhu , Bardiya Sadeghi , Barnaby Simkin , Ben Lanir , Benedikt Schifferer , Besmira Nushi , Bilal Kartal , Bita Darvish Rouhani , Boris Ginsburg , Brandon Norick , Brandon Soubasis , Branislav Kisacanin , Brian Yu , Bryan Catanzaro , Carlo del Mundo , Chantal Hwang , Charles Wang , Cheng-Ping Hsieh , Chenghao Zhang , Chenhan Yu , Chetan Mungekar , Chintan Patel , Chris Alexiuk , Christopher Parisien , Collin Neale , Cyril Meurillon , Damon Mosk-Aoyama , Dan Su , Dane Corneil , Daniel Afrimi , Daniel Lo , Daniel Rohrer , Daniel Serebrenik , Daria Gitman , Daria Levy , Darko Stosic , David Mosallanezhad , Deepak Narayanan , Dhruv Nathawani , Dima Rekesh , Dina Yared , Divyanshu Kakwani , Dong Ahn , Duncan Riach , Dusan Stosic , Edgar Minasyan , Edward Lin , Eileen Long , Eileen Peters Long , Elad Segal , Elena Lantz , Ellie Evans , Elliott Ning , Eric Chung , Eric Harper , Eric Tramel , Erick Galinkin , Erik Pounds , Evan Briones , Evelina Bakhturina , Evgeny Tsykunov , Faisal Ladhak , Fay Wang , Fei Jia , Felipe Soares , Feng Chen , Ferenc Galko , Frank Sun , Frankie Siino , Gal Hubara Agam , Ganesh Ajjanagadde , Gantavya Bhatt , Gargi Prasad , George Armstrong , Gerald Shen , Gorkem Batmaz , Grigor Nalbandyan , Haifeng Qian , Harsh Sharma , Hayley Ross , Helen Ngo , Herbert Hum , Herman Sahota , Hexin Wang , Himanshu Soni , Hiren Upadhyay , Huizi Mao , Huy C Nguyen , Huy Q Nguyen , Iain Cunningham , Ido Galil , Ido Shahaf , Igor Gitman , Ilya Loshchilov , Itamar Schen , Itay Levy , Ivan Moshkov , Izik Golan , Izzy Putterman , Jan Kautz , Jane Polak Scowcroft , Jared Casper , Jatin Mitra , Jeffrey Glick , Jenny Chen , Jesse Oliver , Jian Zhang , Jiaqi Zeng , Jie Lou , Jimmy Zhang , Jinhang Choi , Jining Huang , Joey Conway , Joey Guman , John Kamalu , Johnny Greco , Jonathan Cohen , Joseph Jennings , Joyjit Daw , Julien Veron Vialard , Junkeun Yi , Jupinder Parmar , Kai Xu , Kan Zhu , Kari Briski , Katherine Cheung , Katherine Luna , Keith Wyss , Keshav Santhanam , Kevin Shih , Kezhi Kong , Khushi Bhardwaj , Kirthi Shankar , Krishna C. Puvvada , Krzysztof Pawelec , Kumar Anik , Lawrence McAfee , Laya Sleiman , Leon Derczynski , Li Ding , Lizzie Wei , Lucas Liebenwein , Luis Vega , Maanu Grover , Maarten Van Segbroeck , Maer Rodrigues de Melo , Mahdi Nazemi , Makesh Narsimhan Sreedhar , Manoj Kilaru , Maor Ashkenazi , Marc Romeijn , Marcin Chochowski , Mark Cai , Markus Kliegl , Maryam Moosaei , Matt Kulka , Matvei Novikov , Mehrzad Samadi , Melissa Corpuz , Mengru Wang , Meredith Price , Michael Andersch , Michael Boone , Michael Evans , Miguel Martinez , Mikail Khona , Mike Chrzanowski , Minseok Lee , Mohammad Dabbah , Mohammad Shoeybi , Mostofa Patwary , Nabin Mulepati , Najeeb Nabwani , Natalie Hereth , Nave Assaf , Negar Habibi , Neta Zmora , Netanel Haber , Nicola Sessions , Nidhi Bhatia , Nikhil Jukar , Nikki Pope , Nikolai Ludwig , Nima Tajbakhsh , Nir Ailon , Nirmal Juluru , Nishant Sharma , Oleksii Hrinchuk , Oleksii Kuchaiev , Olivier Delalleau , Oluwatobi Olabiyi , Omer Ullman Argov , Omri Puny , Oren Tropp , Ouye Xie , Parth Chadha , Pasha Shamis , Paul Gibbons , Pavlo Molchanov , Pawel Morkisz , Peter Dykas , Peter Jin , Pinky Xu , Piotr Januszewski , Pranav Prashant Thombre , Prasoon Varshney , Pritam Gundecha , Przemek Tredak , Qing Miao , Qiyu Wan , Rabeeh Karimi Mahabadi , Rachit Garg , Ran El-Yaniv , Ran Zilberstein , Rasoul Shafipour , Rich Harang , Rick Izzo , Rima Shahbazyan , Rishabh Garg , Ritika Borkar , Ritu Gala , Riyad Islam , Robert Hesse , Roger Waleffe , Rohit Watve , Roi Koren , Ruoxi Zhang , Russell Hewett , Russell J. Hewett , Ryan Prenger , Ryan Timbrook , Sadegh Mahdavi , Sahil Modi , Samuel Kriman , Sangkug Lim , Sanjay Kariyappa , Sanjeev Satheesh , Saori Kaji , Satish Pasumarthi , Saurav Muralidharan , Sean Narentharen , Sean Narenthiran , Seonmyeong Bak , Sergey Kashirsky , Seth Poulos , Shahar Mor , Shanmugam Ramasamy , Shantanu Acharya , Shaona Ghosh , Sharath Turuvekere Sreenivas , Shelby Thomas , Shiqing Fan , Shreya Gopal , Shrimai Prabhumoye , Shubham Pachori , Shubham Toshniwal , Shuoyang Ding , Siddharth Singh , Simeng Sun , Smita Ithape , Somshubra Majumdar , Soumye Singhal , Stas Sergienko , Stefania Alborghetti , Stephen Ge , Sugam Dipak Devare , Sumeet Kumar Barua , Suseella Panguluri , Suyog Gupta , Sweta Priyadarshi , Syeda Nahida Akter , Tan Bui , Teodor-Dumitru Ene , Terry Kong , Thanh Do , Tijmen Blankevoort , Tim Moon , Tom Balough , Tomer Asida , Tomer Bar Natan , Tomer Ronen , Tugrul Konuk , Twinkle Vashishth , Udi Karpas , Ushnish De , Vahid Noorozi , Vahid Noroozi , Venkat Srinivasan , Venmugil Elango , Victor Cui , Vijay Korthikanti , Vinay Rao , Vitaly Kurin , Vitaly Lavrukhin , Vladimir Anisimov , Wanli Jiang , Wasi Uddin Ahmad , Wei Du , Wei Ping , Wenfei Zhou , Will Jennings , William Zhang , Wojciech Prazuch , Xiaowei Ren , Yashaswi Karnati , Yejin Choi , Yev Meyer , Yi-Fu Wu , Yian Zhang , Yigong Qin , Ying Lin , Yonatan Geifman , Yonggan Fu , Yoshi Subara , Yoshi Suhara , Yubo Gao , Zach Moshe , Zhen Dong , Zhongbo Zhu , Zihan Liu , Zijia Chen , Zijie Yan

Visual language models (VLMs) have made significant advances in accuracy in recent years. However, their efficiency has received much less attention. This paper introduces NVILA, a family of open VLMs designed to jointly optimize efficiency…

In this paper, we introduce Flash-VL 2B, a novel approach to optimizing Vision-Language Models (VLMs) for real-time applications, targeting ultra-low latency and high throughput without sacrificing accuracy. Leveraging advanced…

Computer Vision and Pattern Recognition · Computer Science 2025-05-15 Bo Zhang , Shuo Li , Runhe Tian , Yang Yang , Jixin Tang , Jinhao Zhou , Lin Ma

We introduce the Llama-Nemotron series of models, an open family of heterogeneous reasoning models that deliver exceptional reasoning capabilities, inference efficiency, and an open license for enterprise use. The family comes in three…

Computation and Language · Computer Science 2025-09-10 Akhiad Bercovich , Itay Levy , Izik Golan , Mohammad Dabbah , Ran El-Yaniv , Omri Puny , Ido Galil , Zach Moshe , Tomer Ronen , Najeeb Nabwani , Ido Shahaf , Oren Tropp , Ehud Karpas , Ran Zilberstein , Jiaqi Zeng , Soumye Singhal , Alexander Bukharin , Yian Zhang , Tugrul Konuk , Gerald Shen , Ameya Sunil Mahabaleshwarkar , Bilal Kartal , Yoshi Suhara , Olivier Delalleau , Zijia Chen , Zhilin Wang , David Mosallanezhad , Adi Renduchintala , Haifeng Qian , Dima Rekesh , Fei Jia , Somshubra Majumdar , Vahid Noroozi , Wasi Uddin Ahmad , Sean Narenthiran , Aleksander Ficek , Mehrzad Samadi , Jocelyn Huang , Siddhartha Jain , Igor Gitman , Ivan Moshkov , Wei Du , Shubham Toshniwal , George Armstrong , Branislav Kisacanin , Matvei Novikov , Daria Gitman , Evelina Bakhturina , Prasoon Varshney , Makesh Narsimhan , Jane Polak Scowcroft , John Kamalu , Dan Su , Kezhi Kong , Markus Kliegl , Rabeeh Karimi Mahabadi , Ying Lin , Sanjeev Satheesh , Jupinder Parmar , Pritam Gundecha , Brandon Norick , Joseph Jennings , Shrimai Prabhumoye , Syeda Nahida Akter , Mostofa Patwary , Abhinav Khattar , Deepak Narayanan , Roger Waleffe , Jimmy Zhang , Bor-Yiing Su , Guyue Huang , Terry Kong , Parth Chadha , Sahil Jain , Christine Harvey , Elad Segal , Jining Huang , Sergey Kashirsky , Robert McQueen , Izzy Putterman , George Lam , Arun Venkatesan , Sherry Wu , Vinh Nguyen , Manoj Kilaru , Andrew Wang , Anna Warno , Abhilash Somasamudramath , Sandip Bhaskar , Maka Dong , Nave Assaf , Shahar Mor , Omer Ullman Argov , Scot Junkin , Oleksandr Romanenko , Pedro Larroy , Monika Katariya , Marco Rovinelli , Viji Balas , Nicholas Edelman , Anahita Bhiwandiwalla , Muthu Subramaniam , Smita Ithape , Karthik Ramamoorthy , Yuting Wu , Suguna Varshini Velury , Omri Almog , Joyjit Daw , Denys Fridman , Erick Galinkin , Michael Evans , Shaona Ghosh , Katherine Luna , Leon Derczynski , Nikki Pope , Eileen Long , Seth Schneider , Guillermo Siman , Tomasz Grzegorzek , Pablo Ribalta , Monika Katariya , Chris Alexiuk , Joey Conway , Trisha Saar , Ann Guan , Krzysztof Pawelec , Shyamala Prayaga , Oleksii Kuchaiev , Boris Ginsburg , Oluwatobi Olabiyi , Kari Briski , Jonathan Cohen , Bryan Catanzaro , Jonah Alben , Yonatan Geifman , Eric Chung

We present DeepSeek-VL2, an advanced series of large Mixture-of-Experts (MoE) Vision-Language Models that significantly improves upon its predecessor, DeepSeek-VL, through two key major upgrades. For the vision component, we incorporate a…

The application of Large Vision-Language Models (LVLMs) for analyzing images and videos is an exciting and rapidly evolving field. In recent years, we've seen significant growth in high-quality image-text datasets for fine-tuning image…

Computer Vision and Pattern Recognition · Computer Science 2024-12-13 Han Wang , Yuxiang Nie , Yongjie Ye , Deng GuanYu , Yanjie Wang , Shuai Li , Haiyang Yu , Jinghui Lu , Can Huang

We introduce NVLM 1.0, a family of frontier-class multimodal large language models (LLMs) that achieve state-of-the-art results on vision-language tasks, rivaling the leading proprietary models (e.g., GPT-4o) and open-access models (e.g.,…

Computation and Language · Computer Science 2024-10-24 Wenliang Dai , Nayeon Lee , Boxin Wang , Zhuolin Yang , Zihan Liu , Jon Barker , Tuomas Rintamaki , Mohammad Shoeybi , Bryan Catanzaro , Wei Ping

Large Language Models (LLMs) have demonstrated exceptional proficiency in text understanding and embedding tasks. However, their potential in multimodal representation, particularly for item-to-item (I2I) recommendations, remains…

Information Retrieval · Computer Science 2025-01-22 Chao Zhang , Haoxin Zhang , Shiwei Wu , Di Wu , Tong Xu , Xiangyu Zhao , Yan Gao , Yao Hu , Enhong Chen

Retrieval-Augmented Generation (RAG) systems have been popular for generative applications, powering language models by injecting external knowledge. Companies have been trying to leverage their large catalog of documents (e.g. PDFs,…

We introduce MobileVLM V2, a family of significantly improved vision language models upon MobileVLM, which proves that a delicate orchestration of novel architectural design, an improved training scheme tailored for mobile VLMs, and rich…

Computer Vision and Pattern Recognition · Computer Science 2024-02-07 Xiangxiang Chu , Limeng Qiao , Xinyu Zhang , Shuang Xu , Fei Wei , Yang Yang , Xiaofei Sun , Yiming Hu , Xinyang Lin , Bo Zhang , Chunhua Shen

We introduce SAIL-VL2, an open-suite vision-language foundation model (LVM) for comprehensive multimodal understanding and reasoning. As the successor to SAIL-VL, SAIL-VL2 achieves state-of-the-art performance at the 2B and 8B parameter…

Computer Vision and Pattern Recognition · Computer Science 2025-09-22 Weijie Yin , Yongjie Ye , Fangxun Shu , Yue Liao , Zijian Kang , Hongyuan Dong , Haiyang Yu , Dingkang Yang , Jiacong Wang , Han Wang , Wenzhuo Liu , Xiao Liang , Shuicheng Yan , Chao Feng

Beginning with VisualGLM and CogVLM, we are continuously exploring VLMs in pursuit of enhanced vision-language fusion, efficient higher-resolution architecture, and broader modalities and applications. Here we propose the CogVLM2 family, a…

We present DeepSeek-VL, an open-source Vision-Language (VL) Model designed for real-world vision and language understanding applications. Our approach is structured around three key dimensions: We strive to ensure our data is diverse,…

Artificial Intelligence · Computer Science 2024-03-12 Haoyu Lu , Wen Liu , Bo Zhang , Bingxuan Wang , Kai Dong , Bo Liu , Jingxiang Sun , Tongzheng Ren , Zhuoshu Li , Hao Yang , Yaofeng Sun , Chengqi Deng , Hanwei Xu , Zhenda Xie , Chong Ruan

Current vision-language models (VLMs) still exhibit inferior performance on knowledge-intensive tasks, primarily due to the challenge of accurately encoding all the associations between visual objects and scenes to their corresponding…

Computation and Language · Computer Science 2024-10-16 Jingyuan Qi , Zhiyang Xu , Rulin Shao , Yang Chen , Jin Di , Yu Cheng , Qifan Wang , Lifu Huang

We present F2LLM-v2, a new family of general-purpose, multilingual embedding models in 8 distinct sizes ranging from 80M to 14B. Trained on a newly curated composite of 60 million publicly available high-quality data samples, F2LLM-v2…

Computation and Language · Computer Science 2026-03-20 Ziyin Zhang , Zihan Liao , Hang Yu , Peng Di , Rui Wang

We present Florence-VL, a new family of multimodal large language models (MLLMs) with enriched visual representations produced by Florence-2, a generative vision foundation model. Unlike the widely used CLIP-style vision transformer trained…

Computer Vision and Pattern Recognition · Computer Science 2024-12-06 Jiuhai Chen , Jianwei Yang , Haiping Wu , Dianqi Li , Jianfeng Gao , Tianyi Zhou , Bin Xiao
‹ Prev 1 2 3 10 Next ›