中文

NICE:面向LLM社交智能的理论 grounding 诊断基准

人工智能 2026-05-29 v1

摘要

随着大型语言模型(LLM)在情感伴侣和客户服务等社交情境中的应用日益增多,衡量其社交智能对确保人机交互的质量和安全性至关重要。然而,现有的社交智能基准缺乏一种将社交能力组织成统一框架的框架,因此无法实现细粒度的诊断。为构建第一个以社交理论为基础的全面诊断评估,我们首先通过文献综述和多阶段专家验证,确立一个以心理测量原则为指导的社交智能框架。 resulting framework 包括4个类别和11个维度,每个维度进一步细化为具体的能力面。基于该框架,我们引入NICE(Norm, Interaction, Cognition, Experience),一个包含137个项目的诊断基准,通过代表性中国语境来操作化。对于5个前沿LLM和一个人类参考组,模型在整体准确率上得分更高,但显示出在Communication方面存在持续性弱点,该框架将其局部化为3个具体的能力面:多轮交流、非语言交流和同步性。NICE因此将社交智能评估重新框架化为针对LLM中社交相关弱点的理论 grounding 诊断。

关键词

引用

@article{arxiv.2605.29685,
  title  = {NICE: A Theory-Grounded Diagnostic Benchmark for Social Intelligence of LLMs},
  author = {Yunjin Qi and Zhaojun Jiang and Xuan Wu and Hanxi Pan and Yixuan Wang and Yanfang Liu and Xiang Ji and Churu Yu and Chunyuan Zheng and Yingze Chen and Jie He and Liuqing Chen and Zaifeng Gao},
  journal= {arXiv preprint arXiv:2605.29685},
  year   = {2026}
}