理解大语言模型中利他主义的机制
综合经济学
2026-04-22 v1 经济学
摘要
利他主义是人类社会的基本特征, 促进合作与社会凝聚力。最近的研究表明, 大型语言模型(LLM)可以显示出类似人类的利他行为, 但产生此类行为的内部计算机制尚不清楚。我们采用稀疏自编码器(SAE)来探究LLM利他主义背后的机制。在标准的Dictator Game中, 仅社会立场(慷慨与自私)不同的最小对照提示会引起分配的大幅、经济上有意义的变化。借助此对比, 我们识别出一组SAE特征(模型各层所有特征中仅占0.024%)的激活情况, 与行为变化密切相关。为解释这些特征, 我们使用以双过程理论为灵感的基准任务对其中一部分进行分类, 确定其主要为直觉式(System 1)或主要为 deliberative(System 2)。因果干预验证了其功能作用: 激活修补和连续引导这些特征方向可可靠地改变分配分布, 其中System 2特征对模型最终输出的影响更为直接。该引导方向在多个社交偏好游戏中均得到验证。总体而言, 这些结果增进了对人工认知的理解, 将利他行为转化为可识别的网络状态,为实现LLM行为与人类价值观的对齐提供了框架, 从而为更透明和价值导向的部署提供了信息。
引用
@article{arxiv.2604.19260,
title = {Understanding the Mechanism of Altruism in Large Language Models},
author = {Shuhuai Zhang and Shu Wang and Zijun Yao and Chuanhao Li and Xiaozhi Wang and Songfa Zhong and Tracy Xiao Liu},
journal= {arXiv preprint arXiv:2604.19260},
year = {2026}
}