中文

LLM 能否生成用户故事并评估其质量?

软件工程 2025-07-22 v1 人工智能

摘要

需求征集仍是需求工程过程中最具挑战性的活动之一,由于需求分析师在理解和将复杂需求转化为具体需求方面的困难。此外,指定高质量的需求至关重要,因为这直接影响要开发的软件质量。虽然自动化工具允许评估需求的语法质量,但评估语义指标(例如语言清晰度、内部一致性)仍然是手动且耗时的活动。本文探讨了 LLM 在敏捷框架中帮助自动化需求征集的可能性,其中需求定义为用户故事 (US)。我们使用 10 种最先进的 LLM 来调查其自动生成 US 的能力,通过模拟客户访谈来实现。我们评估了 LLM 生成的 US 质量,并将其与由人类(领域专家和学生)生成的 US 进行比较。我们也探讨了 LLM 能否用于自动评估 US 的语义质量。我们的结果表明,LLM 能在覆盖范围和风格质量方面类似于人类生成 US,但表现出较低的多样性和创造性。尽管 LLM 生成的 US 在质量上大致相当于人类创建的 US,但无论 LLM 模型规模如何,都倾向于不太频繁地满足接受质量准则。最后,LLM 在提供明确评估准则时能够可靠地评估 US 的语义质量,并有潜力减少大规模评估中的人力成本。

关键词

引用

@article{arxiv.2507.15157,
  title  = {Can LLMs Generate User Stories and Assess Their Quality?},
  author = {Giovanni Quattrocchi and Liliana Pasquale and Paola Spoletini and Luciano Baresi},
  journal= {arXiv preprint arXiv:2507.15157},
  year   = {2025}
}