CoSToM:面向内在 Theory-of-Mind 对齐的因果导向引导
计算与语言
2026-04-14 v1 人工智能
摘要
Theory of Mind (ToM) 是指归因于他人的心理状态的能力,是社会智能的标志。虽然大语言模型 (LLM) 在标准 ToM 基准测试上表现出色,但我们注意到它们常在复杂任务特定情境下难以泛化,过度依赖提示脚手架来模拟推理。这种内部知识与外部行为之间的根本性误差引出一个根本问题:LLM 是否真正拥有内在认知,能否将这种内部知识外部化为稳定、高质量的行为?为此,我们提出 CoSToM (Causal-oriented Steering for ToM alignment),一个从机制解释转向主动干预的框架。首先,我们采用因果追踪映射 ToM 特征的内部分布,实证揭示了各内部层在编码基本 ToM 语义方面的特征。基于此洞见,我们在这些 ToM 关键层中实施轻量级对齐框架,通过定向激活引导实现。实验表明,CoSToM 在提升类人社交推理能力和下游对话质量方面显著有效。
引用
@article{arxiv.2604.10031,
title = {CoSToM:Causal-oriented Steering for Intrinsic Theory-of-Mind Alignment in Large Language Models},
author = {Mengfan Li and Xuanhua Shi and Yang Deng},
journal= {arXiv preprint arXiv:2604.10031},
year = {2026}
}
备注
Accepted to ACL 2026 (Main Conference)