中文

波斯语情感分析与社交媒体文本情绪检测中大型语言模型的比较评估

计算与语言 2025-09-19 v1

摘要

本研究对四种最先进的大型语言模型(LLM)——Claude 3.7 Sonnet、DeepSeek-V3、Gemini 2.0 Flash和GPT-4o——进行情感分析和情绪检测进行全面比较评估。近年来,LLM之间的比较分析有所显著增长,然而,这些分析大多针对英语语言任务进行,导致对跨语言性能模式的理解存在空白。本研究通过严格的实验设计使用平衡的波斯语数据集完成上述任务,其中包括900篇文本用于情感分析(积极、消极、中性)和1800篇文本用于情绪检测(愤怒、恐惧、幸福、厌恨、悲伤、惊讶)。主要关注点是通过使用一致的提示、统一的处理参数以及分析精度、召回率和F1分数等绩效指标,以及分析误分类模式,实现不同模型之间的直接公平比较。结果表明,所有模型都达到了可接受的性能水平,并且对最佳三个模型的统计比较显示它们之间不存在显著差异。然而,GPT-4o在两个任务上表现出略高的原始准确率,而Gemini 2.0 Flash则证明是最具成本效益的。研究结果表明,情绪检测任务对所有模型都比情感分析任务更具挑战性,误分类模式可以代表波斯语文本中的一些挑战。这项研究为波斯语NLP应用建立了性能基准,为基于准确性、效率和成本考虑的模型选择提供了实用指导,同时揭示了需要在多语言AI系统部署中考虑的文化和语言挑战。

关键词

引用

@article{arxiv.2509.14922,
  title  = {A Comparative Evaluation of Large Language Models for Persian Sentiment Analysis and Emotion Detection in Social Media Texts},
  author = {Kian Tohidi and Kia Dashtipour and Simone Rebora and Sevda Pourfaramarz},
  journal= {arXiv preprint arXiv:2509.14922},
  year   = {2025}
}

备注

19 pages, 8 Figures, 9 Tables