评估基于LLM的目标提取在需求工程中的表现:提示策略及其局限性
软件工程
2026-04-27 v1 人工智能
计算与语言
摘要
由于许多需求工程(Requirements Engineering, RE) artefact 的文本性和重复性,大型语言模型(LLM) 在其生成与处理方面已被证明非常有用。本文讨论了通过从软件文档中提取功能目标来自动化目标导向需求工程(GOriented Requirements Engineering, GORE)过程的可能方法,包括三个阶段:演员识别、高层目标提取和低层目标提取。为实现这些功能,我们提出了由工程化提示词驱动的LLM链。我们实验了不同的零样本学习和少数样本学习变体,并测量了输入数据与零样本/少数样本示例之间的相似性,以更好地探讨其影响。另一个关键元素是生成-批评机制,作为涉及两个LLM的反馈循环实现。尽管该管道在低层目标识别方面实现了61%的准确率,但最终阶段的结果表明,这种方法更适合作为加速手动提取的工具,而不是作为完全替代品。反馈循环机制与零样本学习相比优于独立的少数样本学习,消融研究表明在没有反馈循环的情况下性能略有下降。然而,我们报告称,反馈机制与少数样本学习的组合并未带来任何优势,可能表明主要的性能瓶颈是应用于'批评'LLM的提示策略。与其细化两种提示示例的数量和质量,未来的研究将集成检索增强生成(RAG)和链式思维(CoT)提示,以提高准确率。
引用
@article{arxiv.2604.22207,
title = {Evaluating LLM-Based Goal Extraction in Requirements Engineering: Prompting Strategies and Their Limitations},
author = {Anna Arnaudo and Riccardo Coppola and Maurizio Morisio and Flavio Giobergia and Andrea Bioddo and Angelo Bongiorno and Luca Dadone},
journal= {arXiv preprint arXiv:2604.22207},
year = {2026}
}
备注
10 pages, 1 figure. This contribution will be published in the conference proceedings of EASE 2026 Conference (https://conf.researchr.org/home/ease-2026/prompt-se-2026)