中文

模型规模是否重要?小型与大型语言模型在需求分类任务中的比较

软件工程 2025-10-27 v1 人工智能 计算与语言

摘要

[背景与动机] 大语言模型 (LLM) 在需求工程 (RE) 的自然语言处理任务中表现突出。然而,其高计算成本、数据共享风险以及对外部服务的依赖,限制了实际应用。在 contrast 中,小型语言模型 (SLM) 提供了轻量级、可本地部署的替代方案。[问题/疑问] 如何评估 SLM 在 RE 任务中是否达到与 LLM 相当的准确率仍不明确。[结果] 我们的初步研究在需求分类任务上比较了八个模型,包括三个 LLM 和五个 SLM,分别使用 PROMISE、PROMISE Reclass 和 SecReq 数据集。我们的结果表明,尽管 LLM 在所有数据集上的平均 F1 分数比 SLM 高出约 2%,但这一差异在统计上并不显著。SLM 在所有数据集上几乎达到了 LLM 的水平,甚至在 PROMISE Reclass 数据集上在召回率方面超过了 LLM,尽管其规模最多可小 300 倍。我们还发现,数据集特征对性能的影响大于模型规模。[贡献] 我们的研究提供了证据表明,SLM 是需求分类任务中 LLM 的有效替代方案,具有隐私保护、成本效益和本地部署等优势。

关键词

引用

@article{arxiv.2510.21443,
  title  = {Does Model Size Matter? A Comparison of Small and Large Language Models for Requirements Classification},
  author = {Mohammad Amin Zadenoori and Vincenzo De Martino and Jacek Dabrowski and Xavier Franch and Alessio Ferrari},
  journal= {arXiv preprint arXiv:2510.21443},
  year   = {2025}
}