English
Related papers

Related papers: Gemini 2.5: Pushing the Frontier with Advanced Rea…

200 papers

Recent advances in language model (LM) agents have demonstrated significant potential for automating complex real-world tasks. To make progress on these difficult tasks, LM agent architectures have become increasingly complex, often…

Computation and Language · Computer Science 2025-05-14 Mingjian Jiang , Yangjun Ruan , Luis Lastras , Pavan Kapanipathi , Tatsunori Hashimoto

Large language models (LLMs) can answer questions and reason about complex tasks, also from the scientific domain. We assess several multimodal LLMs (MLLMs) on ScienceQA and find that Gemini models show the highest accuracy with little…

Computation and Language · Computer Science 2025-03-04 Florian Dreyer , Ekaterina Kolos , Daria Matiash

Recent strides in video generation have paved the way for unified audio-visual generation. In this work, we present Seedance 1.5 pro, a foundational model engineered specifically for native, joint audio-video generation. Leveraging a…

Computer Vision and Pattern Recognition · Computer Science 2025-12-24 Team Seedance , Heyi Chen , Siyan Chen , Xin Chen , Yanfei Chen , Ying Chen , Zhuo Chen , Feng Cheng , Tianheng Cheng , Xinqi Cheng , Xuyan Chi , Jian Cong , Jing Cui , Qinpeng Cui , Qide Dong , Junliang Fan , Jing Fang , Zetao Fang , Chengjian Feng , Han Feng , Mingyuan Gao , Yu Gao , Dong Guo , Qiushan Guo , Boyang Hao , Qingkai Hao , Bibo He , Qian He , Tuyen Hoang , Ruoqing Hu , Xi Hu , Weilin Huang , Zhaoyang Huang , Zhongyi Huang , Donglei Ji , Siqi Jiang , Wei Jiang , Yunpu Jiang , Zhuo Jiang , Ashley Kim , Jianan Kong , Zhichao Lai , Shanshan Lao , Yichong Leng , Ai Li , Feiya Li , Gen Li , Huixia Li , JiaShi Li , Liang Li , Ming Li , Shanshan Li , Tao Li , Xian Li , Xiaojie Li , Xiaoyang Li , Xingxing Li , Yameng Li , Yifu Li , Yiying Li , Chao Liang , Han Liang , Jianzhong Liang , Ying Liang , Zhiqiang Liang , Wang Liao , Yalin Liao , Heng Lin , Kengyu Lin , Shanchuan Lin , Xi Lin , Zhijie Lin , Feng Ling , Fangfang Liu , Gaohong Liu , Jiawei Liu , Jie Liu , Jihao Liu , Shouda Liu , Shu Liu , Sichao Liu , Songwei Liu , Xin Liu , Xue Liu , Yibo Liu , Zikun Liu , Zuxi Liu , Junlin Lyu , Lecheng Lyu , Qian Lyu , Han Mu , Xiaonan Nie , Jingzhe Ning , Xitong Pan , Yanghua Peng , Lianke Qin , Xueqiong Qu , Yuxi Ren , Kai Shen , Guang Shi , Lei Shi , Yan Song , Yinglong Song , Fan Sun , Li Sun , Renfei Sun , Yan Sun , Zeyu Sun , Wenjing Tang , Yaxue Tang , Zirui Tao , Feng Wang , Furui Wang , Jinran Wang , Junkai Wang , Ke Wang , Kexin Wang , Qingyi Wang , Rui Wang , Sen Wang , Shuai Wang , Tingru Wang , Weichen Wang , Xin Wang , Yanhui Wang , Yue Wang , Yuping Wang , Yuxuan Wang , Ziyu Wang , Guoqiang Wei , Wanru Wei , Di Wu , Guohong Wu , Hanjie Wu , Jian Wu , Jie Wu , Ruolan Wu , Xinglong Wu , Yonghui Wu , Ruiqi Xia , Liang Xiang , Fei Xiao , XueFeng Xiao , Pan Xie , Shuangyi Xie , Shuang Xu , Jinlan Xue , Shen Yan , Bangbang Yang , Ceyuan Yang , Jiaqi Yang , Runkai Yang , Tao Yang , Yang Yang , Yihang Yang , ZhiXian Yang , Ziyan Yang , Songting Yao , Yifan Yao , Zilyu Ye , Bowen Yu , Jian Yu , Chujie Yuan , Linxiao Yuan , Sichun Zeng , Weihong Zeng , Xuejiao Zeng , Yan Zeng , Chuntao Zhang , Heng Zhang , Jingjie Zhang , Kuo Zhang , Liang Zhang , Liying Zhang , Manlin Zhang , Ting Zhang , Weida Zhang , Xiaohe Zhang , Xinyan Zhang , Yan Zhang , Yuan Zhang , Zixiang Zhang , Fengxuan Zhao , Huating Zhao , Yang Zhao , Hao Zheng , Jianbin Zheng , Xiaozheng Zheng , Yangyang Zheng , Yijie Zheng , Jiexin Zhou , Jiahui Zhu , Kuan Zhu , Shenhan Zhu , Wenjia Zhu , Benhui Zou , Feilong Zuo

Can language models (LMs) self-refine their own responses? This question is increasingly relevant as a wide range of real-world user interactions involve refinement requests. However, prior studies have largely tested LMs' refinement…

Computation and Language · Computer Science 2025-12-01 Young-Jun Lee , Seungone Kim , Byung-Kwan Lee , Minkyeong Moon , Yechan Hwang , Jong Myoung Kim , Graham Neubig , Sean Welleck , Ho-Jin Choi

The debate between self-interpretable models and post-hoc explanations for black-box models is central to Explainable AI (XAI). Self-interpretable models, such as concept-based networks, offer insights by connecting decisions to…

Machine Learning · Computer Science 2025-02-26 Shaobo Wang , Hongxuan Tang , Mingyang Wang , Hongrui Zhang , Xuyang Liu , Weiya Li , Xuming Hu , Linfeng Zhang

Comprehending long visual documents, where information is distributed across extensive pages of text and visual elements, is a critical but challenging task for modern Vision-Language Models (VLMs). Existing approaches falter on a…

Computer Vision and Pattern Recognition · Computer Science 2025-11-17 Dawei Zhu , Rui Meng , Jiefeng Chen , Sujian Li , Tomas Pfister , Jinsung Yoon

Despite recent advancements in large language models (LLMs), their performance on complex reasoning problems requiring multi-step thinking and combining various skills is still limited. To address this, we propose a novel framework HDFlow…

Computation and Language · Computer Science 2024-09-27 Wenlin Yao , Haitao Mi , Dong Yu

We present LongCat-Flash-Thinking, an efficient 560-billion-parameter open-source Mixture-of-Experts (MoE) reasoning model. Its advanced capabilities are cultivated through a meticulously crafted training process, beginning with long…

Artificial Intelligence · Computer Science 2025-11-10 Meituan LongCat Team , Anchun Gui , Bei Li , Bingyang Tao , Bole Zhou , Borun Chen , Chao Zhang , Chao Zhang , Chengcheng Han , Chenhui Yang , Chi Zhang , Chong Peng , Chuyu Zhang , Cong Chen , Fengcun Li , Gang Xu , Guoyuan Lin , Hao Jiang , Hao Liang , Haomin Fu , Haoxiang Ma , Hong Liu , Hongyan Hao , Hongyin Tang , Hongyu Zang , Hongzhi Ni , Hui Su , Jiahao Liu , Jiahuan Li , Jialin Liu , Jianfei Zhang , Jianhao Xu , Jianing Wang , Jiaqi Sun , Jiaqi Zhang , Jiarong Shi , Jiawei Yang , Jingang Wang , Jinrui Ding , Jun Kuang , Jun Xu , Ke He , Kefeng Zhang , Keheng Wang , Keqing He , Li Wei , Liang Shi , Lin Qiu , Lingbin Kong , Lingchuan Liu , Linsen Guo , Longfei An , Mai Xia , Meng Zhou , Mengshen Zhu , Peng Pei , Pengcheng Jia , Qi Gu , Qi Guo , Qiong Huang , Quan Chen , Quanchi Weng , Rongxiang Weng , Ruichen Shao , Rumei Li , Shanglin Lei , Shuai Du , Shuaikang Liu , Shuang Zhou , Shuhao Hu , Siyu Xu , Songshan Gong , Tao Liang , Tianhao Hu , Wei He , Wei Shi , Wei Wang , Wei Wu , Wei Zhuo , Weifeng Tang , Wenjie Shi , Wenlong Zhu , Xi Su , Xiangcheng Liu , Xiangyu Xi , Xiangzhou Huang , Xiao Liu , Xiaochen Jiang , Xiaowei Shi , Xiaowen Shi , Xiaoyu Li , Xin Chen , Xinyue Zhao , Xuan Huang , Xuemiao Zhang , Xuezhi Cao , Xunliang Cai , Yajie Zhang , Yang Chen , Yang Liu , Yang Liu , Yang Zheng , Yaoming Wang , Yaqi Huo , Yerui Sun , Yifan Lu , Yiyang Li , Youshao Xiao , Yuanzhe Lei , Yuchen Xie , Yueqing Sun , Yufei Zhang , Yuhuai Wei , Yulei Qian , Yunke Zhao , Yuqing Ding , Yuwei Jiang , Zhaohua Yang , Zhengyu Chen , Zhijian Liu , Zhikang Xia , Zhongda Su , Ziran Li , Ziwen Wang , Ziyuan Zhuang , Zongyu Wang , Zunyuan Yang

This paper presents a novel approach to extract scientifically valuable information about Earth's physical phenomena from unconventional sources, such as multi-modal social media posts. Employing a state-of-the-art large language model…

This study presents the first examination of the ability of Large Language Models (LLMs) to follow reasoning strategies that are used to guide Automated Theorem Provers (ATPs). We evaluate the performance of GPT4, GPT3.5 Turbo and Google's…

Computation and Language · Computer Science 2024-07-31 Lachlan McGinness , Peter Baumgartner

Large Language Models (LLMs) excel in linguistic tasks but struggle with mathematical reasoning, particularly in non English languages like Hindi. This research aims to enhance the mathematical reasoning skills of smaller, resource…

Computation and Language · Computer Science 2024-12-25 Avinash Anand , Kritarth Prasad , Chhavi Kirtani , Ashwin R Nair , Manvendra Kumar Nema , Raj Jaiswal , Rajiv Ratn Shah

Training Vision Language Models (VLMs) for video event reasoning requires high-quality structured annotations capturing not only what happened, but when, where, why, and with what consequence, at a scale manual labelling cannot support. We…

Computer Vision and Pattern Recognition · Computer Science 2026-05-22 Han Zhang , Wanting Jiang , Tomasz Kornuta , Tian Zheng , Vidya Murali

Multimodal Artificial Intelligence (AI) systems, particularly Vision-Language Models (VLMs), have become integral to critical applications ranging from autonomous decision-making to automated document processing. As these systems scale,…

Artificial Intelligence · Computer Science 2025-12-05 M Zeeshan , Saud Satti

Evaluating large language models (LLMs) as judges is increasingly critical for building scalable and trustworthy evaluation pipelines. We present ScalingEval, a large-scale benchmarking study that systematically compares 36 LLMs, including…

Artificial Intelligence · Computer Science 2025-11-06 Tao Zhang , Kehui Yao , Luyi Ma , Jiao Chen , Reza Yousefi Maragheh , Kai Zhao , Jianpeng Xu , Evren Korpeoglu , Sushant Kumar , Kannan Achan

With LLM usage becoming widespread across countries, languages, and humanity more broadly, the need to understand and guardrail their multilingual responses increases. Large-scale datasets for testing and benchmarking have been created to…

Computation and Language · Computer Science 2025-10-13 Kimaya Basu , Savi Kolari , Allison Yu

This study quantifies gender and skin-tone bias in two widely deployed commercial image generators - Gemini Flash 2.5 Image (NanoBanana) and GPT Image 1.5 - to test the assumption that neutral prompts yield demographically neutral outputs.…

Artificial Intelligence · Computer Science 2026-02-13 Roberto Balestri

Effectiveness and interpretability are two essential properties for trustworthy AI systems. Most recent studies in visual reasoning are dedicated to improving the accuracy of predicted answers, and less attention is paid to explaining the…

Computer Vision and Pattern Recognition · Computer Science 2022-03-14 Shi Chen , Qi Zhao

As large language models increasingly deployed into agentic systems, existing methods face critical gaps in observing, assessing, and mitigating deployment-specific risks. We present a comprehensive, observability-driven workflow: we…

Computation and Language · Computer Science 2026-04-28 Ilham Wicaksono , Zekun Wu , Rahul Patel , Theo King , Adriano Koshiyama , Philip Treleaven

Large language models (LLMs) such as GPT-5 and Gemini 3 have pushed the frontier of automated reasoning and code generation. Yet current benchmarks emphasize accuracy and output quality, neglecting a critical dimension: efficiency of token…

Computation and Language · Computer Science 2026-02-25 Zheng Du , Hao Kang , Song Han , Tushar Krishna , Ligeng Zhu
‹ Prev 1 8 9 10 Next ›