中文

面向从应用评论中提取软件需求的 Seq2seq 框架

软件工程 2025-07-22 v2

摘要

移动应用评论是软件改进的大规模数据源。在此背景下,有效从应用评论中提取需求以分析用户需求并支持软件演化是关键任务。近期研究表明,现有方法在此任务上表现不佳,因为应用评论通常包含非正式语言、语法和拼写错误,以及大量可能对开发者无直接实际价值的无关信息。为此,我们提出一种新颖的需求提取表述方式,将其建模为命名实体识别 (NER) 任务,基于序列到序列 (Seq2seq) 生成方法。为此,我们提出了 Seq2seq 框架,采用双向 LSTM 编码器和 LSTM 解码器,增强了自注意力机制、GloVe 嵌入和条件随机场 (CRF) 模型。我们在两个数据集上评估了该框架:一个包含 1000 条人工标注评论的数据集 (数据集 1) 和一个包含 23,816 条众包评论的数据集 (数据集 2)。定量评估表明,该框架在数据集 2 上以 0.96 的 F1 分数超越了现有最先进方法,在数据集 1 上以 0.47 的 F1 分数实现了可比性能。

关键词

引用

@article{arxiv.2507.09039,
  title  = {Towards Extracting Software Requirements from App Reviews using Seq2seq Framework},
  author = {Aakash Sorathiya and Gouri Ginde},
  journal= {arXiv preprint arXiv:2507.09039},
  year   = {2025}
}