中文

利用大语言模型衡量交通领域开放科学现状

数字图书馆 2026-01-22 v1 人工智能 计算机与社会 新兴技术

摘要

开放科学倡议已在多个领域增强了科研诚信并加速了研究进展,但其在交通研究领域的实践状况仍缺乏深入调查。开放科学的关键特征(本文定义为数据和代码的可获取性)由于该领域固有的复杂性而难以提取。以往的研究要么因人工分析劳动密集而局限于小规模研究,要么依赖牺牲上下文丰富性的大规模文献计量方法。本文介绍了一种自动化、可扩展的特征提取流程,用于衡量交通研究中的数据和代码可获取性。我们采用大语言模型(LLMs)完成此任务,并通过人工标注数据集和评分者间一致性分析验证其性能。我们将该流程应用于分析2019年至2024年间发表在《Transportation Research Part》系列期刊上的10,724篇研究文章。分析发现,仅5%的定量论文共享了代码仓库,4%共享了数据仓库,约3%同时共享了二者,且不同期刊、主题和地理区域的趋势存在差异。我们发现,提供数据和代码的论文与未提供的论文在引用次数或审稿时长上无显著差异,这表明开放科学努力与传统学术指标之间存在错位。因此,鼓励这些实践可能需要期刊和资助机构采取结构性干预措施,以弥补作者直接激励的缺失。本研究开发的流程可轻松扩展至其他期刊,这标志着向自动测量和监测交通研究领域开放科学实践迈出了关键一步。

关键词

引用

@article{arxiv.2601.14429,
  title  = {Measuring the State of Open Science in Transportation Using Large Language Models},
  author = {Junyi Ji and Ruth Lu and Linda Belkessa and Liming Wang and Silvia Varotto and Yongqi Dong and Nicolas Saunier and Mostafa Ameli and Gregory S. Macfarlane and Bahman Madadi and Cathy Wu},
  journal= {arXiv preprint arXiv:2601.14429},
  year   = {2026}
}