HEART:评估人类与大语言模型在情感支持对话中能力的统一基准
计算与语言
2026-02-26 v2 人工智能
摘要
支持性对话依赖超越语言流畅性的技能,包括情感读取、语气调整以及应对抵抗、沮丧或痛苦情境的能力。尽管语言模型取得了快速进展,我们仍缺乏清晰的方式来理解这些人际交往能力如何与人类相比较。我们引入HEART,这是首个直接在同一套多轮情感支持对话中比较人类与大语言模型能力的框架。对于每段对话历史,我们配对人类与模型的回应,并通过盲选人类评估者和基于大语言模型的评估者 ensemble 进行评估。所有评估都遵循基于人际交往科学的评估标准,涵盖五个维度:人类一致性、共情响应、情感共鸣、共振与任务遵循。HEART 揭示了引人注目的行为模式。多个前沿模型在感知到的共情性和一致性方面已接近或超过平均人类水平。与此同时,人类在自适应重构、情绪命名以及细微语气变化方面保持优势,尤其在对抗性回合中。人类与大语言模型评估者的偏好在约80%的两两比较中一致,与人类间一致性相当,其书面理由强调相似的HEART维度。这一模式表明,评估支持性质量标准正在出现趋同。通过将人类与模型置于平等位置,HEART 将支持性对话重新定义为一个独立的能力轴,与一般推理或语言流畅性分离。它为理解模型生成支持与人类社交判断的对齐性、差异性,以及情感对话能力随模型规模而扩展提供了统一的实证基础。
引用
@article{arxiv.2601.19922,
title = {HEART: A Unified Benchmark for Assessing Humans and LLMs in Emotional Support Dialogue},
author = {Laya Iyer and Kriti Aggarwal and Sanmi Koyejo and Gail Heyman and Desmond C. Ong and Subhabrata Mukherjee},
journal= {arXiv preprint arXiv:2601.19922},
year = {2026}
}