中文

Social-R1:面向类人社交推理的 LLM

人工智能 2026-03-11 v1

摘要

虽然大型语言模型在诸多领域展现出惊人的能力,但社交智能——感知社交线索、推断心理状态并生成恰当响应的能力——仍然是关键挑战,尤其是在实现有效的人机协作和发展真正服务于人类的 AI 方面。当前模型往往依赖浅层模式而非真正的社交推理。我们认为培养类人社交智能需要通过提供难以被捷径解决方案所克服的训练案例。为此,我们引入 ToMBench-Hard,一个旨在为社交推理提供困难训练样本的对抗基准。基于此,我们提出 Social-R1,一种通过多维奖励实现模型推理与人类认知对齐的强化学习框架。不同于基于结果的 RL,Social-R1 监督整个推理过程,强制实现结构对齐、逻辑完整性和信息密度。结果表明,我们的方法使 4B 参数模型超越更大规模的模型,在八个多样化基准上实现稳健的泛化。这些发现表明,具备轨迹级对齐的具挑战性训练样本为实现高效可靠的社交智能提供了一条路径。

关键词

引用

@article{arxiv.2603.09249,
  title  = {Social-R1: Towards Human-like Social Reasoning in LLMs},
  author = {Jincenzi Wu and Yuxuan Lei and Jianxun Lian and Yitian Huang and Lexin Zhou and Haotian Li and Xing Xie and Helen Meng},
  journal= {arXiv preprint arXiv:2603.09249},
  year   = {2026}
}

备注

27 pages. Code and dataset will be released upon acceptance