中文

LLMs捕获情感标签而非情感不确定性:分布分析与人类LLM判断差距的校准

计算与语言 2026-05-04 v2

摘要

人类标注员在情感标签上经常存在分歧,但大多数大语言模型(LLM)情感标注评估却将这些判断Collapsed为单一的黄金标准,丢弃了这种分歧所编码的分布信息。我们询问LLMs是否捕捉到了这种分歧的结构,而不仅仅是多数标签,通过将人类标注员与四个零样本LLMs以及一个微调RoBERTa基线模型的情感判断分布进行比较,分别基于两个互补基准:GoEmotions和EmoBank,总计640,000个LLM响应。在零样本模型与人类分布之间存在显著差异,仅需模型规模并非关闭差距的关键在于模型内在。我们通过量化透明度分数构建了一梯度,以预测每个情感类别的人类-LLM一致性:LLMs可靠地捕捉到具有明确词汇标记的情感,但在系统性地失败于需要上下文推理的实用主义复杂情感,这一模式在两个情感框架中均得到复制。我们进一步提出了三种轻量级后验校准方法,可将分布差距缩小最高达14%,并提供实际指南,指导何时可以以及不能将LLM情感标注替代为人类标注。

关键词

引用

@article{arxiv.2604.27345,
  title  = {LLMs Capture Emotion Labels, Not Emotion Uncertainty: Distributional Analysis and Calibration of Human-LLM Judgment Gaps},
  author = {Keito Inoshita and Xiaokang Zhou and Akira Kawai and Katsutoshi Yada},
  journal= {arXiv preprint arXiv:2604.27345},
  year   = {2026}
}