中文

大语言模型在评判共情沟通中的可靠性如何

计算与语言 2025-10-06 v2 人机交互

摘要

大语言模型(LLMs)在基于文本的对话中擅长生成共情回应。但它们在评判共情沟通的细微差别时有多可靠?本研究通过比较专家、众包工作者和 LLMs 在四个评估框架下对共情沟通的标注情况来探讨这一问题,这些框架源自心理学、自然语言处理和传播学,并应用于 200 个真实对话场景——其中一个说话者分享个人问题,另一个提供支持。基于 3,150 条专家标注、2,844 条众包标注和 3,150 条 LLM 标注,我们评估了这三个标注者群体之间的评分者间一致性。我们发现,专家一致性较高,但会因评估框架子组件的清晰性、复杂性和主观性而异。我们表明,专家一致性为情境化 LLM 表现提供了比标准分类指标更具信息量的基准。在所有四个框架中,LLMs 始终接近这一专家水平基准,并超过众包工作者的可靠性。这些结果表明,当在特定任务上以适当的基准进行验证时,LLMs 可以支持透明度和监督,包括将其用作对话伴侣。

关键词

引用

@article{arxiv.2506.10150,
  title  = {When Large Language Models are Reliable for Judging Empathic Communication},
  author = {Aakriti Kumar and Nalin Poungpeth and Diyi Yang and Erina Farrell and Bruce Lambert and Matthew Groh},
  journal= {arXiv preprint arXiv:2506.10150},
  year   = {2025}
}