中文

探索 ChatGPT 的零样本应用评论分类:挑战与潜力

软件工程 2025-05-09 v1 人工智能

摘要

应用评论是用户反馈的重要来源,提供有关应用性能、功能、可用性以及整体用户体验的宝贵见解。有效地分析这些评论对于指导应用开发、优先处理功能更新和提升用户满意度至关重要。将评论分类为功能性需求和非功能性需求在区分与特定应用功能相关的反馈(功能性需求)与涉及性能、可用性和可靠性等更广泛质量属性的反馈(非功能性需求)方面发挥关键作用。这两个类别对做出明智的开发决策至关重要。传统方法受限于需要大型领域特定数据集,这些数据集往往昂贵且耗时。本研究探讨了使用 ChatGPT 对应用评论进行零样本分类的潜力,将其分为四个类别:功能性需求、非功能性需求、两者兼具或无关。我们在来自十个跨越多个领域的应用的 1880 条人工标注评论的基准数据集上评估了 ChatGPT 的性能。我们的发现表明,尽管存在某些挑战和局限性,ChatGPT 在评论分类方面实现了稳健的 F1 分数为 0.842。此外,我们还检查了评论可读性和长度如何影响分类准确性,并进行了手动分析以识别更易发生误分类的评论类别。

关键词

引用

@article{arxiv.2505.04759,
  title  = {Exploring Zero-Shot App Review Classification with ChatGPT: Challenges and Potential},
  author = {Mohit Chaudhary and Chirag Jain and Preethu Rose Anish},
  journal= {arXiv preprint arXiv:2505.04759},
  year   = {2025}
}