零样本设定下ChatGPT在需求信息检索上的实证评估
软件工程
2023-07-20 v2 人工智能
摘要
近来,各种示例展示了生成式大语言模型(LLM)执行NLP相关任务的惊人能力。ChatGPT无疑是最具代表性的模型。我们对ChatGPT在需求信息检索(IR)任务上的表现进行实证评估,以期为基于生成式LLM设计或开发更有效的需求检索方法或工具提供见解。我们设计了一个评估框架,考虑了两种流行IR任务与两种常见制品类型的四种不同组合。在零样本设定下,评估结果显示ChatGPT检索需求相关信息的能力令人期待(高召回率),而检索更具体需求信息的能力有限(低精确率)。我们在零样本设定下对ChatGPT在需求IR上的评估,为基于LLM设计或开发更有效的需求IR方法或工具提供了初步证据。
引用
@article{arxiv.2304.12562,
title = {Empirical Evaluation of ChatGPT on Requirements Information Retrieval Under Zero-Shot Setting},
author = {Jianzhang Zhang and Yiyang Chen and Nan Niu and Yinglin Wang and Chuang Liu},
journal= {arXiv preprint arXiv:2304.12562},
year = {2023}
}