中文

大型语言模型是否像人类一样判断错误严重程度?

计算与语言 2025-06-10 v2

摘要

大型语言模型 (LLMs) 越来越多地被用作自然语言生成的自动评估器,但是否能准确复制人类对错误严重程度的判断仍不明确。在本研究中,我们系统比较了人类和 LLM 对包含受控语义错误的图像描述的评估。我们将 van Miltenburg 等人 (2020) 的实验框架扩展到单模态 (文本-only) 和多模态 (文本 + 图像) 两种设置,评估四类错误类型:年龄、性别、服装类型和服装颜色。我们的发现表明,人类对不同错误类型赋予不同的严重程度水平,视觉上下文显著放大了对颜色和类型错误的感知严重程度。值得注意的是,大多数 LLM 对性别错误给予低分,但对颜色错误给予远高于人类的高分,与人类不同,后者对两者都认为严重,但原因不同。这表明这些模型可能内化了影响性别判断的社会规范,但缺乏感知依 grounding 以模仿人类对颜色的敏感性,这种敏感性由不同的神经机制塑造。只有一个被评估的 LLM,豆包,复制了人类类似错误严重程度的排序,但未能清晰区分错误类型。令人惊讶的是,DeepSeek-V3 这一单模态 LLM 在单模态和多模态条件下均实现了最高的人类判断一致性,甚至超过了最先进的多模态模型。

关键词

引用

@article{arxiv.2506.05142,
  title  = {Do Large Language Models Judge Error Severity Like Humans?},
  author = {Diege Sun and Guanyi Chen and Zhao Fan and Xiaorong Cheng and Tingting He},
  journal= {arXiv preprint arXiv:2506.05142},
  year   = {2025}
}