从评论到需求:大语言模型能否生成类人用户故事?
计算与语言
2026-03-31 v1
摘要
应用商店评论提供了关于真实用户反馈的持续输入,这些反馈可帮助改进软件需求。然而,这些评论往往杂乱、非正式,难以在规模化时进行手动分析。虽然已存在自动化技术,但许多方法在复制时表现不佳,常常难以产生干净、可直接用于敏捷项目的用户故事。本研究评估了大型语言模型(LLM)如 GPT-3.5 Turbo、Gemini 2.0 Flash 和 Mistral 7B Instruct 从原始 app 评论直接生成可用用户故事的能力。我们使用包含 1000 多条健康类 app 评论的 Mini-BAR 数据集,测试了零-shot、one-shot 和 two-shot 提示方法。我们采用 RUST 框架进行人类判断,并使用在 UStAI 上微调的 RoBERTa 分类器来评估生成用户故事的整体质量。我们的结果表明,大语言模型在书写流畅、格式良好的用户故事方面可以与人类相当乃至优于人类,尤其是在使用少量样本提示时。然而,它们仍在生成独立且独特的用户故事方面存在困难,这些是构建强大的敏捷 backlog 的关键。总体而言,我们的发现表明,大语言模型可可靠地将非结构化的 app 评论转化为可行动的软件需求,为开发人员提供清晰的指导,使用户反馈转化为有意义的改进。
引用
@article{arxiv.2603.28163,
title = {From Reviews to Requirements: Can LLMs Generate Human-Like User Stories?},
author = {Shadman Sakib and Oishy Fatema Akhand and Tasnia Tasneem and Shohel Ahmed},
journal= {arXiv preprint arXiv:2603.28163},
year = {2026}
}