稀疏性满足敏感性:极端稀疏参数模式对大语言模型心智理论影响
计算与语言
2025-04-08 v1 人工智能
摘要
本文从机制化视角探讨大型语言模型(LLM)中心智理论(Theory-of-Mind, ToM)能力的出现,关注极端稀疏参数模式的作用。我们引入一种新方法,用于识别对ToM敏感的参数,发现即使扰动仅0.001%的这些参数,也会显著降低ToM性能,同时损害情境局部化和语言理解。为理解这一现象,我们分析这些参数与LLM核心架构组件的相互作用。我们的发现表明,这些敏感参数与位置编码模块密切相关,尤其是在采用旋转位置编码(Rotary Position Embedding, RoPE)的模型中,扰动会破坏至关重要的情境处理的主导频率激活。此外,我们展示,扰动ToM敏感参数会影响LLM的注意力机制,通过调制位置编码下查询与键之间的夹角。这些见解提供了更深入的理解,说明LLM如何获得社交推理能力,桥接了AI可解释性与认知科学。我们的结果对增强模型对齐、缓解偏见以及改进旨在与人类互动的AI系统具有启示意义。
引用
@article{arxiv.2504.04238,
title = {Sensitivity Meets Sparsity: The Impact of Extremely Sparse Parameter Patterns on Theory-of-Mind of Large Language Models},
author = {Yuheng Wu and Wentao Guo and Zirui Liu and Heng Ji and Zhaozhuo Xu and Denghui Zhang},
journal= {arXiv preprint arXiv:2504.04238},
year = {2025}
}