中文

基于大型语言模型代理的自动化研究可重复性:阿尔茨海默病的一项探索性研究

计算与语言 2025-06-02 v1 人工智能 多智能体系统 应用统计

摘要

目的:展示大型语言模型(LLM)作为自主代理使用相同或相似数据集复现已发表研究成果的能力。材料与方法:我们使用了国家阿尔茨海默病协调中心(NACC)的“快速访问”数据集。我们识别了使用 NACC 数据的高被引已发表研究手稿,并选择了五项仅使用该数据集即可重现的研究。使用 GPT-4o,我们创建了一个由基于 LLM 的自主代理组成的模拟研究团队,其任务是在仅给定研究摘要、方法部分和数据集的数据字典描述的情况下,编写并执行代码以动态重现每项研究的发现。结果:我们提取了 5 项阿尔茨海默病研究摘要中描述的 35 项关键发现。平均而言,LLM 代理每项研究大约重现了 53.2% 的发现。数值和基于范围的发现在研究和代理之间经常存在差异。代理应用的统计方法或参数也与原始研究不同,尽管总体趋势和显著性有时相似。讨论:在某些情况下,基于 LLM 的代理复现了研究技术和发现。在其他情况下,它们由于实现缺陷或缺失方法细节而失败。这些差异表明 LLM 在完全自动化可重复性评估方面存在当前局限。尽管如此,这项早期调查突出了基于代理的结构化系统在提供可扩展的科学严谨性评估方面的潜力。结论:这项探索性工作说明了 LLM 作为自主代理在生物医学研究中自动化可重复性方面的前景和局限性。

关键词

引用

@article{arxiv.2505.23852,
  title  = {Large Language Model-Based Agents for Automated Research Reproducibility: An Exploratory Study in Alzheimer's Disease},
  author = {Nic Dobbins and Christelle Xiong and Kristine Lan and Meliha Yetisgen},
  journal= {arXiv preprint arXiv:2505.23852},
  year   = {2025}
}