理论心智(ToM)改进真的能提升人类-人工智能互动吗?来自交互式评估的实证发现
人工智能
2026-05-18 v1
摘要
提高大型语言模型(LLM)理论心智(Theory of Mind, ToM)能力对于这些AI模型与人类之间的有效社交互动至关重要。然而,现有基准测试通常通过故事阅读、多选题(从第三人称视角)来衡量ToM能力的提升,而忽略了人类-人工智能(Human-AI, HAI)互动中第一人称、动态且开放式的本质。为直接检验ToM改进技术如何利于HAI互动,本文首先提出了一种新的交互式ToM评估范式,包含视角和度量的转变。随后,遵循该范式,我们系统研究了四种代表性ToM增强技术,运用四个真实世界数据集和一次用户研究,涵盖目标导向任务(如编程、数学)和经验导向任务(如咨询)。我们的发现表明,针对静态基准的改进并不总能转化为动态HAI互动中更好的性能。这篇论文为ToM评估提供了关键见解,展示了在开发面向HAI共生的下一代社会认知LLM时,基于交互的评估的必要性。
引用
@article{arxiv.2605.15205,
title = {Does Theory of Mind Improvement Really Benefit Human-AI Interactions? Empirical Findings from Interactive Evaluations},
author = {Nanxu Gong and Zixin Chen and Haotian Li and Zishu Zhao and Jianxun Lian and Huamin Qu and Yanjie Fu and Xing Xie},
journal= {arXiv preprint arXiv:2605.15205},
year = {2026}
}