SciHorizon:面向科学数据的AI就绪度基准评估框架
机器学习
2025-05-30 v3 计算与语言
数字图书馆
信息检索
摘要
近年来,人工智能(AI)技术,特别是大型语言模型(LLM),的快速发展彻底改变了科学发现的范式,使AI-for-Science(AI4Science)成为一个动态不断发展的领域。然而,目前仍缺乏一种有效的框架,从整体角度对AI4Science进行整体评估,尤其是在数据质量和模型能力方面。因此,本研究提出SciHorizon,一个综合性的评估框架,用于从科学数据和LLM视角衡量AI4Science的成熟度。首先,我们引入一个通用的评估AI就绪科学数据框架,涵盖四个关键维度:质量(Quality)、FAIR性(FAIRness)、可解释性(Explainability)和合规性(Compliance),其中细分为15个子维度。基于2018至2023年间发表于同行评审期刊中的数据资源论文,我们提供面向地球科学、生命科学和材料科学的AI就绪数据集推荐列表,为该领域的创新性贡献。同时,为评估LLM在多个科学领域的能力,我们建立16个评估维度,基于Mathematics、Physics、Chemistry、Life Sciences和Earth and Space Sciences五个核心指标:知识(Knowledge)、理解(Understanding)、推理(Reasoning)、多模态性(Multimodality)和价值(Values)。利用开发的基准数据集,我们对超过50个代表性开源和闭源LLM进行了全面评估。所有结果均公开可用,可在www.scihorizon.cn/en上访问。
关键词
引用
@article{arxiv.2503.13503,
title = {SciHorizon: Benchmarking AI-for-Science Readiness from Scientific Data to Large Language Models},
author = {Chuan Qin and Xin Chen and Chengrui Wang and Pengmin Wu and Xi Chen and Yihang Cheng and Jingyi Zhao and Meng Xiao and Xiangchao Dong and Qingqing Long and Boya Pan and Han Wu and Chengzan Li and Yuanchun Zhou and Hui Xiong and Hengshu Zhu},
journal= {arXiv preprint arXiv:2503.13503},
year = {2025}
}