中文

从学术论文中自动生成研究流程:一个全文挖掘框架

计算与语言 2025-09-24 v2 数字图书馆 信息检索

摘要

研究流程的自动生成对于提高研究的可复现性以及加速“AI for Science”范式至关重要。然而,现有方法通常仅提取零散的程序性组件,因而无法捕获完整的研究流程。为弥补这一差距,我们提出了一个端到端框架,通过挖掘全文学术论文来生成全面、结构化的研究流程。以自然语言处理(NLP)领域为案例研究,我们以段落为中心的方法首先采用基于SciBERT的正例-未标注学习(Positive-Unlabeled Learning, PU Learning)来识别描述工作流程的段落,取得了0.9772的F1分数。随后,我们利用Flan-T5结合提示学习从这些段落中生成工作流程短语,分别获得了0.4543、0.2877和0.4427的ROUGE-1、ROUGE-2和ROUGE-L分数。这些短语随后通过ChatGPT结合少样本学习被系统地归类到数据准备、数据处理和数据分析阶段,分类精确率达到0.958。通过将分类后的短语映射到其在文档中的位置,我们最终生成了整个研究流程的可读可视化流程图。该方法有助于分析从NLP语料库中提取的工作流程,并揭示了近二十年来关键的方法论转变,包括对数据分析的日益重视以及从特征工程到消融研究的过渡。我们的工作为自动化工作流程生成提供了一个经过验证的技术框架,并为实证研究不断演变的科学范式提供了一种新颖的、面向过程的视角。源代码和数据可在以下地址获取:https://github.com/ZH-heng/research_workflow。

关键词

引用

@article{arxiv.2509.12955,
  title  = {Automated Generation of Research Workflows from Academic Papers: A Full-text Mining Framework},
  author = {Heng Zhang and Chengzhi Zhang},
  journal= {arXiv preprint arXiv:2509.12955},
  year   = {2025}
}