中文

超越文字:通过理论心智评估与桥接用户-代理交互中的认识分歧

计算与语言 2026-02-17 v1

摘要

大型语言模型(LLM)已迅速发展并广泛应用于通用目的和专业任务以协助人类用户。然而,它们仍在处理意图和指令不够精确表达时难以理解和响应真实用户需求,导致主观用户信念与真实环境状态之间的差异。解决这种认识分歧需要理论心智(ToM),然而现有ToM评估主要聚焦于孤立信念推断,忽视其在实际交互中的功能效用。为此,我们将ToM formalize 为认识分歧检测与解决的机制,并提出基准测试 \benchname 来评估模型在实践中如何调和用户信念与档案。结果显示,11个领先模型在识别潜在认知差距方面存在显著局限,这些差距会阻碍任务成功。为弥合这一差距,我们进一步构建了连接信念跟踪与任务相关状态推断的轨迹型ToM数据集。采用强化学习训练的模型在关于用户心理状态的推理方面持续获得改进,进而提升下游性能。我们的工作凸显了ToM作为一种关键交互层面机制而非独立推理技能的实际价值。

关键词

引用

@article{arxiv.2602.13832,
  title  = {Beyond Words: Evaluating and Bridging Epistemic Divergence in User-Agent Interaction via Theory of Mind},
  author = {Minyuan Ruan and Ziyue Wang and Kaiming Liu and Yunghwei Lai and Peng Li and Yang Liu},
  journal= {arXiv preprint arXiv:2602.13832},
  year   = {2026}
}