中文

Text2Stories:衡量利益相关者访谈与生成用户故事对齐程度

计算与语言 2025-10-13 v1 软件工程

摘要

大型语言模型(LLMs)可用于自动从自然语言输入(如访谈记录)生成软件需求。然而,评估这些派生需求是否忠实反映用户访谈中表达的需求仍是主要依赖手动任务的环节。我们引入Text2Stories,一个用于文本到故事对齐的任务和指标,允许量化需求(以用户故事形式)与访谈中实际表达需求的匹配程度。给定面试记录和一组用户故事,我们的指标量化(i)正确性:由记录支持的故事比例;以及(ii)完整性:由至少一个故事支持的记录比例。我们将记录分段为文本块,将对齐建模为块与故事之间的匹配问题。实验覆盖四个数据集,显示LLM-based匹配器在 held-out 标注上的宏观F1达到0.86,而仅使用嵌入模型的模型仍落后,但能够有效实现阻塞。最后,我们展示了我们的指标如何 enable 比较不同故事集合(例如人类 vs. 生成),将Text2Stories 定位为可扩展的、源自忠实的补充手段,以增强现有用户故事质量标准。

关键词

引用

@article{arxiv.2510.08622,
  title  = {Text2Stories: Evaluating the Alignment Between Stakeholder Interviews and Generated User Stories},
  author = {Francesco Dente and Fabiano Dalpiaz and Paolo Papotti},
  journal= {arXiv preprint arXiv:2510.08622},
  year   = {2025}
}

备注

8 pages