中文

基于词典的工具仍是低资源佛兰德语效价分析的金标准吗?

计算与语言 2025-12-02 v1

摘要

理解日常语言中的细微差别对于计算语言学和情感研究的进步至关重要。传统的基于词典的工具,如LIWC和Pattern,长期以来一直是该领域的基础工具。LIWC是社会科学中经过最广泛验证的基于词计数的文本分析工具,而Pattern是一个提供NLP功能的开源Python库。然而,日常语言本质上是自发的、富有表现力的,并且高度依赖上下文。为了探索LLM在捕捉佛兰德语日常叙事效价方面的能力,我们首先进行了一项研究,涉及来自102名荷兰语参与者的约25,000条文本回复。每位参与者都根据“现在发生了什么,你对此感觉如何?”这一问题提供了叙事,并附带了在-50到+50连续量表上的自我评估效价评分。然后,我们评估了三个特定于荷兰语的LLM在预测这些效价分数方面的性能,并将其输出与LIWC和Pattern生成的输出进行了比较。我们的研究结果表明,尽管LLM架构取得了进步,但这些荷兰语调优模型目前在准确捕捉自发的、真实世界叙事中存在的情绪效价方面仍有不足。这项研究强调了开发能够熟练处理自然语言使用复杂性的文化和语言定制模型/工具的必要性。增强自动化效价分析不仅对推进计算方法至关重要,而且对心理学研究也具有重要前景,可为人类日常体验提供生态有效的见解。我们主张加大力度创建全面的数据集,并为佛兰德语等低资源语言微调LLM,旨在弥合计算语言学与情感研究之间的差距。

关键词

引用

@article{arxiv.2506.04139,
  title  = {Are Lexicon-Based Tools Still the Gold Standard for Valence Analysis in Low-Resource Flemish?},
  author = {Ratna Kandala and Katie Hoemann},
  journal= {arXiv preprint arXiv:2506.04139},
  year   = {2025}
}