中文

使用大语言模型加速系统综述筛选过程的前景与挑战

计算与语言 2024-05-09 v4 人工智能

摘要

系统综述(SR)是软件工程(SE)中流行的研究方法。然而,完成一次SR平均需要67周。因此,自动化SR过程中任何一步都可以减少与SR相关的工作量。我们的目标是调查是否可以通过简化摘要来加速人类筛选员进行标题-摘要筛选,从而加快标题-摘要筛选的速度。我们进行了一个实验,其中人类筛选员针对20篇论文的原始摘要和简化摘要进行标题-摘要筛选。将该实验中使用人类筛选员的情形复制到GPT-3.5和GPT-4大语言模型(LLM)上,以完成相同的筛选任务。我们还研究了不同的提示技术(零样本(ZS)、一样本(OS)、少样本(FS)和带链式思考的少样本(FS-CoT))是否提高LLM的筛选性能。最后,我们研究了重新设计用于LLM筛选复制的提示是否导致性能提升。文本简化并未提高筛选员的筛选性能,但减少了筛选时间。筛选员的科学素养水平和研究人员身份预测了筛选性能。某些LLM和提示组合在筛选任务中表现得与人类筛选员一样好。我们的结果表明,GPT-4 LLM优于其前身GPT-3.5。此外,少样本和一样本提示优于零样本提示。使用LLM进行筛选过程中的文本简化并未显著提高人类水平。使用LLM自动化标题-摘要筛选看起来有前景,但当前的LLM在准确性上不显著优于人类筛选员。要建议在SR筛选过程中使用LLM,还需要更多研究。我们建议未来的SR研究在筛选数据方面发布复制软件包,以便更具决断性地进行LLM筛选实验。

关键词

引用

@article{arxiv.2404.15667,
  title  = {The Promise and Challenges of Using LLMs to Accelerate the Screening Process of Systematic Reviews},
  author = {Aleksi Huotala and Miikka Kuutila and Paul Ralph and Mika Mäntylä},
  journal= {arXiv preprint arXiv:2404.15667},
  year   = {2024}
}

备注

Accepted to the International Conference on Evaluation and Assessment in Software Engineering (EASE), 2024 edition