English
Related papers

Related papers: An Empirical Study on Eliciting and Improving R1-l…

200 papers

While Large Language Models (LLMs) achieve high performance on standard mathematical benchmarks, their problem-solving abilities depend on the context and textual formatting. We introduce the Robust Reasoning Benchmark (RRB), a pipeline of…

Machine Learning · Computer Science 2026-05-22 Pavel Golikov , Evgenii Opryshko , Gennady Pekhimenko , Mark C. Jeffrey

With the rapid advancement of Artificial Intelligence (AI), Large Language Models (LLMs) have significantly impacted a wide array of domains, including healthcare, engineering, science, education, and mathematical reasoning. Among these,…

Machine Learning · Computer Science 2025-05-20 Afrar Jahin , Arif Hassan Zidan , Wei Zhang , Yu Bao , Tianming Liu

Future robotic systems operating in real-world environments will require on-board embodied intelligence without continuous cloud connection, balancing capabilities with constraints on computational power and memory. This work presents an…

Robotics · Computer Science 2025-09-03 Liam Boyle , Nicolas Baumann , Paviththiren Sivasothilingam , Michele Magno , Luca Benini

Recent studies have shown that making a model spend more time thinking through longer Chain of Thoughts (CoTs) enables it to gain significant improvements in complex reasoning tasks. While current researches continue to explore the benefits…

Computation and Language · Computer Science 2025-10-14 Wenkai Yang , Shuming Ma , Yankai Lin , Furu Wei

Recent advancements in the reasoning capabilities of large language models (LLMs) show that employing group relative policy optimization (GRPO) algorithm for reinforcement learning (RL) training allows the models to use more…

Computation and Language · Computer Science 2025-07-04 Purbesh Mitra , Sennur Ulukus

Reasoning is a key component of language understanding in Large Language Models. While Chain-of-Thought prompting enhances performance via explicit intermediate steps, it suffers from sufficient token overhead and a fixed reasoning…

Computation and Language · Computer Science 2025-11-18 Xinyuan Wang , Dongjie Wang , Wangyang Ying , Haoyue Bai , Nanxu Gong , Sixun Dong , Kunpeng Liu , Yanjie Fu

Recent advancements in large language models (LLMs) have demonstrated impressive chain-of-thought reasoning capabilities, with reinforcement learning (RL) playing a crucial role in this progress. While "aha moment" patterns--where models…

Computation and Language · Computer Science 2025-07-24 Lai Wei , Yuting Li , Kaipeng Zheng , Chen Wang , Yue Wang , Linghe Kong , Lichao Sun , Weiran Huang

Recent R1-Zero-like research further demonstrates that reasoning extension has given large language models (LLMs) unprecedented reasoning capabilities, and Reinforcement Learning is the core technology to elicit its complex reasoning.…

Artificial Intelligence · Computer Science 2025-08-15 Anxiang Zeng , Haibo Zhang , Kaixiang Mo , Long Zhang , Shuman Liu , Yanhui Huang , Yawen Liu , Yuepeng Sheng , Yuwei Huang

Recent advancements in large reasoning models (LRMs) have introduced an intermediate "thinking" process prior to generating final answers, improving their reasoning capabilities on complex downstream tasks. However, the potential of LRMs as…

Computation and Language · Computer Science 2025-10-24 Runzhe Zhan , Zhihong Huang , Xinyi Yang , Lidia S. Chao , Min Yang , Derek F. Wong

Large Language Models (LLMs) have shown impressive performance in reasoning tasks. However, LLMs tend to generate excessively long reasoning content, leading to significant computational overhead. Our observations indicate that even on…

Computation and Language · Computer Science 2025-05-21 Guochao Jiang , Guofeng Quan , Zepeng Ding , Ziqin Luo , Dixuan Wang , Zheng Hu

Reinforcement learning substantially improves reasoning in large language models, but it also tends to lengthen chain of thought outputs and increase computational cost during both training and inference. Though length control methods have…

Computation and Language · Computer Science 2026-02-12 Daisuke Nohara , Taishi Nakamura , Rio Yokota

The AM-DeepSeek-R1-Distilled is a large-scale dataset with thinking traces for general reasoning tasks, composed of high-quality and challenging reasoning problems. These problems are collected from a multitude of open-source datasets,…

Computation and Language · Computer Science 2025-03-26 Han Zhao , Haotian Wang , Yiping Peng , Sitong Zhao , Xiaoyu Tian , Shuaiting Chen , Yunjie Ji , Xiangang Li

Recently DeepSeek R1 demonstrated how reinforcement learning with simple rule-based incentives can enable autonomous development of complex reasoning in large language models, characterized by the "aha moment", in which the model manifest…

Artificial Intelligence · Computer Science 2025-03-11 Hengguang Zhou , Xirui Li , Ruochen Wang , Minhao Cheng , Tianyi Zhou , Cho-Jui Hsieh

Large language models (LLMs) have exhibited impressive reasoning abilities on a wide range of complex tasks. However, enhancing these capabilities through post-training remains resource intensive, particularly in terms of data and…

Artificial Intelligence · Computer Science 2025-08-13 Shuo Cai , Su Lu , Qi Zhou , Kejing Yang , Zhijie Sang , Congkai Xie , Hongxia Yang

We introduce Seed1.5-Thinking, capable of reasoning through thinking before responding, resulting in improved performance on a wide range of benchmarks. Seed1.5-Thinking achieves 86.7 on AIME 2024, 55.0 on Codeforces and 77.3 on GPQA,…

Computation and Language · Computer Science 2025-04-30 ByteDance Seed , : , Jiaze Chen , Tiantian Fan , Xin Liu , Lingjun Liu , Zhiqi Lin , Mingxuan Wang , Chengyi Wang , Xiangpeng Wei , Wenyuan Xu , Yufeng Yuan , Yu Yue , Lin Yan , Qiying Yu , Xiaochen Zuo , Chi Zhang , Ruofei Zhu , Zhecheng An , Zhihao Bai , Yu Bao , Xingyan Bin , Jiangjie Chen , Feng Chen , Hongmin Chen , Riwei Chen , Liangqiang Chen , Zixin Chen , Jinsong Chen , Siyan Chen , Kaiyuan Chen , Zhi Chen , Jin Chen , Jiecao Chen , Jinxin Chi , Weinan Dai , Ning Dai , Jiahui Dai , Shihan Dou , Yantao Du , Zhengyin Du , Jianhui Duan , Chen Dun , Ting-Han Fan , Jiazhan Feng , Junda Feng , Ziyuan Feng , Yuwei Fu , Wenqi Fu , Hanjie Fu , Hao Ge , Hongyi Guo , Mingji Han , Li Han , Wenhao Hao , Xintong Hao , Qianyu He , Jerry He , Feng He , Wen Heng , Zehua Hong , Qi Hou , Liang Hu , Shengding Hu , Nan Hu , Kai Hua , Qi Huang , Ziyue Huang , Hongzhi Huang , Zihao Huang , Ting Huang , Wenhao Huang , Wei Jia , Bin Jia , Xiaoying Jia , Yuhua Jiang , Haobin Jiang , Ziheng Jiang , Kaihua Jiang , Chengquan Jiang , Jianpeng Jiao , Xiaoran Jin , Xing Jin , Xunhao Lai , Zheng Li , Xiang Li , Liyi Li , Hongkai Li , Zheng Li , Shengxian Wan , Ya Wang , Yunshui Li , Chenggang Li , Niuniu Li , Siyu Li , Xi Li , Xiao Li , Aoyan Li , Yuntao Li , Nianning Liang , Xinnian Liang , Haibin Lin , Weijian Lin , Ye Lin , Zhicheng Liu , Guanlin Liu , Guanlin Liu , Chenxiao Liu , Yan Liu , Gaohong Liu , Juncai Liu , Chundian Liu , Deyi Liu , Kaibo Liu , Siyao Liu , Qi Liu , Yongfei Liu , Kang Liu , Gan Liu , Boyi Liu , Rui Long , Weiqiang Lou , Chenwei Lou , Xiang Luo , Yao Luo , Caiping Lv , Heyang Lv , Bole Ma , Qianli Ma , Hongzhi Ma , Yiyuan Ma , Jin Ma , Wenchang Ma , Tingting Ma , Chen Mao , Qiyang Min , Zhe Nan , Guanghan Ning , Jinxiang Ou , Haojie Pan , Renming Pang , Yanghua Peng , Tao Peng , Lihua Qian , Lihua Qian , Mu Qiao , Meng Qu , Cheng Ren , Hongbin Ren , Yong Shan , Wei Shen , Ke Shen , Kai Shen , Guangming Sheng , Jinlong Shi , Wenlei Shi , Guang Shi , Shuai Shuai Cao , Yuxin Song , Zuquan Song , Jing Su , Yifan Sun , Tao Sun , Zewei Sun , Borui Wan , Zihan Wang , Xiaohui Wang , Xi Wang , Shuguang Wang , Jun Wang , Qinlong Wang , Chenyuan Wang , Shuai Wang , Zihan Wang , Changbao Wang , Jiaqiang Wang , Shihang Wang , Xuwu Wang , Zaiyuan Wang , Yuxuan Wang , Wenqi Wang , Taiqing Wang , Chengzhi Wei , Houmin Wei , Ziyun Wei , Shufa Wei , Zheng Wu , Yonghui Wu , Yangjun Wu , Bohong Wu , Shuang Wu , Jingqiao Wu , Ning Wu , Shuangzhi Wu , Jianmin Wu , Chenguang Xi , Fan Xia , Yuqiao Xian , Liang Xiang , Boren Xiang , Bowen Xiao , Zhen Xiao , Xia Xiao , Yongsheng Xiao , Chao Xin , Shulin Xin , Yuwen Xiong , Jingjing Xu , Ziwen Xu , Chenyin Xu , Jiayi Xu , Yifan Xu , Wei Xu , Yufei Xu , Shikun Xu , Shipeng Yan , Shen Yan , Qingping Yang , Xi Yang , Tianhao Yang , Yuehang Yang , Yuan Yang , Ximing Yang , Zeyu Yang , Guang Yang , Yifan Yang , Xuesong Yao , Bairen Yi , Fan Yin , Jianian Yin , Ziqiang Ying , Xiangyu Yu , Hongli Yu , Song Yu , Menghan Yu , Huan Yu , Siyu Yuan , Jun Yuan , Yutao Zeng , Tianyang Zhan , Zheng Zhang , Yun Zhang , Mofan Zhang , Wang Zhang , Ru Zhang , Zhi Zhang , Tianqi Zhang , Xinyi Zhang , Zhexi Zhang , Sijun Zhang , Wenqiang Zhang , Xiangxiang Zhang , Yongtao Zhang , Yuyu Zhang , Ge Zhang , He Zhang , Yue Zhang , Renjie Zheng , Ningxin Zheng , Zhuolin Zheng , Yaowei Zheng , Chen Zheng , Xiaoyun Zhi , Wanjun Zhong , Cheng Zhong , Zheng Zhong , Baoquan Zhong , Xun Zhou , Na Zhou , Huan Zhou , Hang Zhu , Defa Zhu , Wenjia Zhu , Lei Zuo

Reinforcement learning (RL) has become a key technique for enhancing the reasoning abilities of large language models (LLMs), with policy-gradient algorithms dominating the post-training stage because of their efficiency and effectiveness.…

Artificial Intelligence · Computer Science 2025-08-08 Chang Tian , Matthew B. Blaschko , Mingzhe Xing , Xiuxing Li , Yinliang Yue , Marie-Francine Moens

Different base language model families, such as Llama and Qwen, exhibit divergent behaviors during post-training with reinforcement learning (RL), especially on reasoning-intensive tasks. What makes a base language model suitable for…

Computation and Language · Computer Science 2025-06-26 Zengzhi Wang , Fan Zhou , Xuefeng Li , Pengfei Liu

Efficiently acquiring external knowledge and up-to-date information is essential for effective reasoning and text generation in large language models (LLMs). Prompting advanced LLMs with reasoning capabilities to use search engines during…

Computation and Language · Computer Science 2025-08-07 Bowen Jin , Hansi Zeng , Zhenrui Yue , Jinsung Yoon , Sercan Arik , Dong Wang , Hamed Zamani , Jiawei Han

Tool-integrated reasoning (TIR) offers a direct way to extend thinking models beyond the limits of text-only reasoning. Paradoxically, we observe that tool-enabled evaluation can degrade reasoning performance even when the strong thinking…

Computation and Language · Computer Science 2026-05-08 Qianjia Cheng , Yuchen Zhang , Zhilin Wang , Yuxin Zuo , Shunkai Zhang , Yuchen Fan , Yu Qiao , Bowen Zhou , Ning Ding , Yu Cheng , Yun Luo , Ganqu Cui

Reinforcement learning (RL) has recently become the dominant paradigm for strengthening the reasoning abilities of large language models (LLMs). Yet the rule-based reward functions commonly used on mathematical or programming benchmarks…

Artificial Intelligence · Computer Science 2025-09-09 Haoyang He , Zihua Rong , Kun Ji , Chenyang Li , Qing Huang , Chong Xia , Lan Yang , Honggang Zhang