中文

基于大语言模型的零样本双语应用评论挖掘

计算与语言 2024-09-04 v1 软件工程

摘要

来自应用商店的评论对改进软件需求至关重要。大量有价值的评论持续发布,描述软件问题与期望功能。有效利用用户评论需要提取相关信息并随后进行总结。由于用户评论数量庞大,人工分析十分费力。已有多种基于自然语言处理(NLP)的方法被提出用于自动用户评论挖掘。然而,其中大多数需要人工标注数据集来训练模型,这限制了其在真实场景中的使用。在本工作中,我们提出 Mini-BAR,一种集成大语言模型(LLMs)以对英语和法语用户评论执行零样本挖掘的工具。具体而言,Mini-BAR 旨在(i)对用户评论进行分类,(ii)将相似评论聚类,(iii)为每个簇生成抽取式摘要,以及(iv)对用户评论簇排序。为评估 Mini-BAR 的性能,我们构建了一个包含 6,000 条英语和 6,000 条法语标注用户评论的数据集并开展了充分实验。初步结果表明,Mini-BAR 通过分析双语应用评论在需求工程中具有有效性与高效性。(复现包含代码、数据集及实验配置,见 https://github.com/Jl-wei/mini-bar)

关键词

引用

@article{arxiv.2311.03058,
  title  = {Zero-shot Bilingual App Reviews Mining with Large Language Models},
  author = {Jialiang Wei and Anne-Lise Courbis and Thomas Lambolais and Binbin Xu and Pierre Louis Bernard and Gérard Dray},
  journal= {arXiv preprint arXiv:2311.03058},
  year   = {2024}
}

备注

Accepted for The 35th IEEE International Conference on Tools with Artificial Intelligence