中文

基于大语言模型的迭代数据生成用于方面情感分析

计算与语言 2024-10-01 v2

摘要

方面情感分析 (ABSA) 是一个重要的情感分析任务,旨在确定句子中针对某个方面的情感极性。由于标注数据昂贵且有限,数据生成 (DG) 已成为提高 ABSA 性能的标准方法。然而,当前的 DG 方法通常存在以下问题:1) 流利性和连贯性差,2) 生成数据的多样性不足,3) 依赖于现有的标注数据,阻碍其在实际场景中的应用。随着大语言模型 (LLM) 的发展,LLM-based DG 有望解决上述问题。然而,直接提示 LLM 难以生成所需的伪标签 ABSA 数据,因为 LLM 容易产生幻觉,导致生成不理想的数据。为此,我们提出了一套系统性的迭代数据生成框架,即 IDG,以提升 ABSA 的性能。IDG 的核心在于充分利用 LLM 的强大能力(即指令遵循、零样本学习和自我反思),从无监督句子语料开始,迭代生成更流畅和多样的伪标签数据。具体而言,IDG 设计了新颖的迭代数据生成机制和自我反思数据过滤模块,以解决因幻觉导致的意外数据生成问题。在四个广泛使用的 ABSA 数据集上进行的大量实验表明,IDG 能为五个基线 ABSA 模型带来持续且显著的性能提升。更令人鼓舞的是,IDG 生成的合成数据可实现与手动标注数据相当甚至更好的性能。

关键词

引用

@article{arxiv.2407.00341,
  title  = {Iterative Data Generation with Large Language Models for Aspect-based Sentiment Analysis},
  author = {Qihuang Zhong and Haiyun Li and Luyao Zhuang and Juhua Liu and Bo Du},
  journal= {arXiv preprint arXiv:2407.00341},
  year   = {2024}
}