加沙战争标题情感分类:大语言模型与阿拉伯语微调BERT模型的比较分析
计算与语言
2026-04-13 v1 机器学习
摘要
本研究检验了不同的人工智能架构如何解释冲突相关媒体话语中的情感,选取2023年加沙战争作为案例研究。基于10,990篇阿拉伯语新闻标题(Eleraqi 2026)构建的语料库,研究采用比较分析方法,对比三种大语言模型和六种微调阿拉伯语BERT模型。本研究不依赖单一的人工标注金标准评估准确率,而是采用一种知识论方法,将情感分类视为由模型架构产生的解释性行为。为量化跨模型的系统性差异,分析采用信息论和分布度量指标,包括香氏熵、耦合-香氏距离,以及衡量偏离总体模型行为的方差得分。结果显示,情感分布呈现显著且非随机的差异。微调BERT模型,特别是MARBERT,表现出强烈的中性分类偏好,而LLMs则持续放大负面情感,其中LLaMA-3.1-8B显示近乎完全归约为负面情感。帧条件分析进一步表明,GPT-4.1会根据叙事框架(如人道主义、法律、安全)调整情感判断,而其他LLMs显示出有限的上下文调制。这些发现表明,模型选择本身即是一种解释性镜头的选择,塑造了冲突叙事如何在算法层面中被框架化和情感评估。本研究为媒体研究和计算社会科学贡献,凸显算法差异作为分析对象的重要性,并强调在战争和危机情境下,将自动情感输出视为中性或可互换的媒体语调衡量标准的风险。
引用
@article{arxiv.2604.08566,
title = {Sentiment Classification of Gaza War Headlines: A Comparative Analysis of Large Language Models and Arabic Fine-Tuned BERT Models},
author = {Amr Eleraqi and Hager H. Mustafa and Abdul Hadi N. Ahmed},
journal= {arXiv preprint arXiv:2604.08566},
year = {2026}
}
备注
45 pages, 6 figures (including diagrams), 8 tables. Dataset available at this https URL . Previously posted at https://dataverse.harvard.edu/dataset.xhtml?persistentId=doi:10.7910/DVN/FFENX3