从人类标注到自动化:面向阿拉伯语情感分析的LLM-in-the-Loop主动学习
计算与语言
2025-09-30 v1 人工智能
摘要
自然语言处理(NLP),尤其是情感分析,在营销、客户服务和社交媒体监控等领域发挥着重要作用,通过提供用户意见和情绪的洞察。然而,阿拉伯语情感分析的进展仍受限于缺乏大规模高质量标注数据集。虽然主动学习在其他语言中已证明有效地减少标注工作,但鲜有研究在阿拉伯语情感任务中进行探索。同样,利用大语言模型(LLM)辅助标注并比较其与人类标注的性能,在阿拉伯语语境中仍 largely 未被探索。本文提出一种针对阿拉伯语情感分析的主动学习框架,以减少标注成本同时保持高性能。我们评估了多种深度学习架构:具体而言包括长短期记忆网络(LSTM)、门控循环单元(GRU)和循环神经网络(RNN),在三个基准数据集上进行测试:Hunger Station、AJGT 和 MASAC,涵盖现代标准阿拉伯语和方言变体。此外,比较了两种标注策略:人工标注和LLM辅助标注。评估了五个LLM作为标注者:GPT-4o、Claude 3 Sonnet、Gemini 2.5 Pro、DeepSeek Chat 和 LLaMA 3 70B Instruct。对于每个数据集,均使用表现最佳的LLM:Hunger Station 使用 GPT-4o,AJGT 使用 Claude 3 Sonnet,MASAC 使用 DeepSeek Chat。我们的结果表明,LLM辅助主动学习在性能上可与人工标注相当或更优。例如,在Hunger Station数据集上,LSTM模型仅使用450个标注样本即可达到93%的准确率,标注标签来自GPT-4o生成;在MASAC数据集上,DeepSeek Chat使用650个标注样本达到82%的准确率,与人工标注获得的准确率相当。
引用
@article{arxiv.2509.23515,
title = {From Human Annotation to Automation: LLM-in-the-Loop Active Learning for Arabic Sentiment Analysis},
author = {Dania Refai and Alaa Dalaq and Doaa Dalaq and Irfan Ahmad},
journal= {arXiv preprint arXiv:2509.23515},
year = {2025}
}