我们仍需人类标注员吗?使用大语言模型进行方面情感四元组预测
计算与语言
2025-05-30 v3
摘要
方面情感四元组预测 (ASQP) 有助于通过识别每个意见的意见词、方面词、方面类别和情感极性来深入理解文本中的意见。然而,为 ASQP 任务准备完整的训练样本进行模型微调是资源密集型的。在本研究中,我们探索了大语言模型 (LLM) 在 ASQP 任务上进行零样本和少样本学习的能力。我们报告的 F1 分数几乎与采用最新微调模型的结果相当,并超过了此前报告的零样本和少样本性能。在餐厅领域数据集 Rest16 的 20-shot 设置下,LLM 获得了 51.54 的 F1 分数,与最佳微调方法 MVP 的 60.39 相当。此外,我们报告了 LLM 在目标方面情感检测 (TASD) 上的性能,在 30-shot 设置下在 Rest16 上达到 68.93 的 F1 分数,与 MVP 的 72.76 相当。尽管人类标注员仍是实现最佳性能所必需的,但 LLM 可以减少 ASQP 任务中大规模人工标注的需求。
引用
@article{arxiv.2502.13044,
title = {Do we still need Human Annotators? Prompting Large Language Models for Aspect Sentiment Quad Prediction},
author = {Nils Constantin Hellwig and Jakob Fehle and Udo Kruschwitz and Christian Wolff},
journal= {arXiv preprint arXiv:2502.13044},
year = {2025}
}