中文

在潜在内容分析中评估大语言模型:情感、政治倾向、情感强度与讽刺

计算与语言 2025-01-07 v1 人工智能 计算机与社会

摘要

在快速数字化通信时代,每天产生大量文本数据,迫切需要高效的方法进行潜在内容分析以提取有意义的见解。大语言模型(LLM)提供了自动化此过程的潜力,但缺乏对其在多个维度上相对于人类标注者的综合评估。本研究评估了七种最先进的LLM,包括OpenAI GPT-4、Gemini、Llama和Mixtral的变体,相对于人类标注者在情感、政治倾向、情感强度和讽刺检测方面的可靠性、一致性和质量。共有 33 名人类标注者和 8 个LLM变体对 100 项精选文本进行评估,产生 3300 条人类标注和 19200 条LLM标注,LLM在三个时间点进行评估以检验时间一致性。使用Krippendorff's alpha 衡量间评者可靠性,采用 intra-class correlation coefficients 评估时间一致性。结果显示,人类和LLM在情感分析和政治倾向评估方面表现出高水平的可靠性,LLM在内部一致性方面优于人类。在情感强度方面,LLM的一致性高于人类,尽管人类对情感强度的评估显著高于LLM。两组在讽刺检测方面表现不佳,表明一致性较低。LLM在所有维度上都表现出优异的时间一致性,表明其性能随时间稳定。这项研究得出结论认为,尤其是GPT-4,大语言模型能够有效复制人类在情感和政治倾向方面的分析,尽管人类专长在情感强度解释方面仍至关重要。该研究表明,LLM在潜在内容分析的某些领域具有一致且高质量的性能潜力。

关键词

引用

@article{arxiv.2501.02532,
  title  = {Evaluating Large Language Models Against Human Annotators in Latent Content Analysis: Sentiment, Political Leaning, Emotional Intensity, and Sarcasm},
  author = {Ljubisa Bojic and Olga Zagovora and Asta Zelenkauskaite and Vuk Vukovic and Milan Cabarkapa and Selma Veseljević Jerkovic and Ana Jovančevic},
  journal= {arXiv preprint arXiv:2501.02532},
  year   = {2025}
}

备注

24 pages, 3 figures