A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers
Abstract
Scientific Large Language Models (Sci-LLMs) are transforming how knowledge is represented, integrated, and applied in scientific research, yet their progress is shaped by the complex nature of scientific data. This survey presents a comprehensive, data-centric synthesis that reframes the development of Sci-LLMs as a co-evolution between models and their underlying data substrate. We formulate a unified taxonomy of scientific data and a hierarchical model of scientific knowledge, emphasizing the multimodal, cross-scale, and domain-specific challenges that differentiate scientific corpora from general natural language processing datasets. We systematically review recent Sci-LLMs, from general-purpose foundations to specialized models across diverse scientific disciplines, alongside an extensive analysis of over 270 pre-/post-training datasets, showing why Sci-LLMs pose distinct demands -- heterogeneous, multi-scale, uncertainty-laden corpora that require representations preserving domain invariance and enabling cross-modal reasoning. On evaluation, we examine over 190 benchmark datasets and trace a shift from static exams toward process- and discovery-oriented assessments with advanced evaluation protocols. These data-centric analyses highlight persistent issues in scientific data development and discuss emerging solutions involving semi-automated annotation pipelines and expert validation. Finally, we outline a paradigm shift toward closed-loop systems where autonomous agents based on Sci-LLMs actively experiment, validate, and contribute to a living, evolving knowledge base. Collectively, this work provides a roadmap for building trustworthy, continually evolving artificial intelligence (AI) systems that function as a true partner in accelerating scientific discovery.
Keywords
Cite
@article{arxiv.2508.21148,
title = {A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers},
author = {Ming Hu and Chenglong Ma and Wei Li and Wanghan Xu and Jiamin Wu and Jucheng Hu and Tianbin Li and Guohang Zhuang and Jiaqi Liu and Yingzhou Lu and Ying Chen and Chaoyang Zhang and Cheng Tan and Jie Ying and Guocheng Wu and Shujian Gao and Pengcheng Chen and Jiashi Lin and Haitao Wu and Lulu Chen and Fengxiang Wang and Yuanyuan Zhang and Xiangyu Zhao and Feilong Tang and Encheng Su and Junzhi Ning and Xinyao Liu and Ye Du and Changkai Ji and Pengfei Jiang and Cheng Tang and Ziyan Huang and Jiyao Liu and Jiaqi Wei and Yuejin Yang and Xiang Zhang and Guangshuai Wang and Yue Yang and Huihui Xu and Ziyang Chen and Yizhou Wang and Chen Tang and Jianyu Wu and Yuchen Ren and Siyuan Yan and Zhonghua Wang and Zhongxing Xu and Shiyan Su and Shangquan Sun and Runkai Zhao and Zhisheng Zhang and Dingkang Yang and Jinjie Wei and Jiaqi Wang and Jiahao Xu and Jiangtao Yan and Wenhao Tang and Hongze Zhu and Yu Liu and Fudi Wang and Yiqing Shen and Yuanfeng Ji and Yanzhou Su and Tong Xie and Hongming Shan and Chun-Mei Feng and Zhi Hou and Diping Song and Lihao Liu and Yanyan Huang and Lequan Yu and Bin Fu and Shujun Wang and Xiaomeng Li and Xiaowei Hu and Yun Gu and Ben Fei and Benyou Wang and Yuewen Cao and Minjie Shen and Jie Xu and Haodong Duan and Fang Yan and Hongxia Hao and Jielan Li and Jiajun Du and Yanbo Wang and Imran Razzak and Zhongying Deng and Chi Zhang and Lijun Wu and Conghui He and Zhaohui Lu and Jinhai Huang and Wenqi Shao and Yihao Liu and Siqi Luo and Yi Xin and Xiaohong Liu and Fenghua Ling and Yuqiang Li and Aoran Wang and Siqi Sun and Qihao Zheng and Nanqing Dong and Tianfan Fu and Dongzhan Zhou and Yan Lu and Wenlong Zhang and Jin Ye and Jianfei Cai and Yirong Chen and Wanli Ouyang and Yu Qiao and Zongyuan Ge and Shixiang Tang and Junjun He and Chunfeng Song and Lei Bai and Bowen Zhou},
journal= {arXiv preprint arXiv:2508.21148},
year = {2025}
}