中文

大语言模型如何有效地从应用评论中提取特征-情感对

计算与语言 2025-02-11 v3 软件工程

摘要

自动分析用户评论以了解用户对应用功能(即应用特征)的情感倾向,有助于将开发工作与用户的期望和需求相结合。近期大型语言模型(LLM)的进展,如 ChatGPT,在无需更新模型参数的情况下(即零样本或少数标记样本)在多个新任务上展现出惊人的性能,但 LLM 在特征特定情感分析中的能力尚未得到探索。本研究旨在探索 LLM 执行特征特定情感分析的能力。本研究将最先进的 LLM,包括 GPT-4、ChatGPT 和不同的 Llama-2 变体,与以前的方法进行比较,评估其在零样本、1 样本和 5 样本情景下提取应用特征及其关联情感的性能。结果表明,GPT-4 在零样本情景下提取应用特征的 F1 分数比基于规则的 SAFE 方法高出 17%,5 样本情景进一步提高 6%。然而,微调的 RE-BERT 在 F1 分数上超过 GPT-4 高出 6%。对于预测正面和中性情感,GPT-4 在零样本设置下的 F1 分数分别为 76% 和 45%,在 5 样本设置下分别提高至 83% 和 68%。我们的研究对比评估了 proprietary 和开源 LLM,以提供对其在提取特征-情感对方面性能的客观评估。

关键词

引用

@article{arxiv.2409.07162,
  title  = {How Effectively Do LLMs Extract Feature-Sentiment Pairs from App Reviews?},
  author = {Faiz Ali Shah and Ahmed Sabir and Rajesh Sharma and Dietmar Pfahl},
  journal= {arXiv preprint arXiv:2409.07162},
  year   = {2025}
}

备注

The summary of the project is available at https://bit.ly/3XGcRM1