中文

大语言模型与心理学领域的传统情感工具比较:针对比利时荷兰语叙事的评估

计算与语言 2025-11-12 v1

摘要

理解日常语言中情感细微差别对于计算语言学和情感研究至关重要。虽然像LIWC和Pattern这样的词典基方法已作为基础工具服务,但大型语言模型(LLM)有望提供更好的上下文理解。我们对比评估了三个荷兰语专用大语言模型(ChocoLlama-8B-Instruct、Reynaerde-7B-chat和GEITje-7B-ultra)与LIWC和Pattern在弗拉米语(Flemish)低资源语言变体上的价值预测性能。我们的数据集包含约25000个来自102名荷兰语参与者的自发文本响应,每位参与者都描述了其当前经历并给出了自评情感价值(从-50到+50)。令人惊讶的是,尽管架构取得了进步,荷兰语微调的大语言模型仍不如传统方法表现,Pattern显示出优越性能。这一发现挑战了关于大语言模型在情感分析任务中卓越性的假设,凸显了在自发、真实世界叙述中捕捉情感价值的复杂性。我们的结果强调了为低资源语言变体开发文化和语言特定评估框架的必要性,同时质疑了当前大语言模型微调方法是否充分解决了日常语言中细腻情感表达的问题。

关键词

引用

@article{arxiv.2511.07641,
  title  = {LLMs vs. Traditional Sentiment Tools in Psychology: An Evaluation on Belgian-Dutch Narratives},
  author = {Ratna Kandala and Katie Hoemann},
  journal= {arXiv preprint arXiv:2511.07641},
  year   = {2025}
}

备注

NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling