超越标签:衡量低资源、文化细微差异情境下的大语言模型情感
计算与语言
2025-08-07 v1
摘要
在低资源、文化细微差异的情境下进行情感分析挑战了那些假设固定标签和普遍情感表达的常规 NLP 方法。我们提出了一种诊断框架,将情感视为情境依赖、文化嵌入的建构,并评估大语言模型(LLM)如何在非正式、代码混合的内罗毕青年健康组 WhatsApp 消息中进行情感推理。通过结合人工标注数据、情感翻转的反事实样本以及基于 rubric 的解释评估,我们探测 LLM 的可解释性、鲁棒性以及与人类推理的一致性。通过社会科学测量视角来构建我们的评估,我们将 LLM 输出操作化并深入探讨,作为衡量情感这一抽象概念的仪器。我们的发现揭示了模型推理质量存在显著差异,顶级 LLM 显示出解释稳定性,而开源模型常在模糊性或情感变化下出现挑战。这一工作凸显了在复杂现实沟通环境中,对文化敏感、推理导向 AI 评估的必要性。
引用
@article{arxiv.2508.04199,
title = {Reasoning Beyond Labels: Measuring LLM Sentiment in Low-Resource, Culturally Nuanced Contexts},
author = {Millicent Ochieng and Anja Thieme and Ignatius Ezeani and Risa Ueno and Samuel Maina and Keshet Ronen and Javier Gonzalez and Jacki O'Neill},
journal= {arXiv preprint arXiv:2508.04199},
year = {2025}
}