HeartBench:探究大语言模型拟人化智能的核心维度
计算与语言
2025-12-29 v1 人工智能
摘要
尽管大语言模型在认知和推理基准测试中取得了显著成功,但它们在拟人化智能——即驾驭复杂社会、情感和伦理细微差别的能力——方面表现出持续的不足。这一差距在中文语言和文化语境中尤为突出,缺乏专门的评估框架和高质量的社会情感数据阻碍了进展。为了解决这些局限性,我们提出了 HeartBench,一个旨在评估中文 LLMs 综合情感、文化和伦理维度的框架。该基准基于真实的心理咨询场景并与临床专家合作开发,围绕由理论驱动的分类法构建,包含五个主要维度和 15 项次级能力。我们采用特定案例的、基于评分标准的方法论,通过“先推理后评分”的评估协议将抽象的类人特征转化为细粒度、可测量的标准。我们对 13 个最先进的 LLMs 的评估表明存在显著的性能上限:即使是领先模型也仅达到专家定义理想分数的 60%。此外,使用难度分层的“困难集”进行的分析揭示,在涉及微妙情感潜台词和复杂伦理权衡的场景中,性能显著下降。HeartBench 为拟人化 AI 评估建立了标准化指标,并为构建高质量、人类对齐的训练数据提供了方法论蓝图。
引用
@article{arxiv.2512.21849,
title = {HeartBench: Probing Core Dimensions of Anthropomorphic Intelligence in LLMs},
author = {Jiaxin Liu and Peiyi Tu and Wenyu Chen and Yihong Zhuang and Xinxia Ling and Anji Zhou and Chenxi Wang and Zhuo Han and Zhengkai Yang and Junbo Zhao and Zenan Huang and Yuanyuan Wang},
journal= {arXiv preprint arXiv:2512.21849},
year = {2025}
}
备注
10 pages