中文

在巴别之影下:语言如何塑造LLM的推理

计算与语言 2025-06-23 v1 人工智能

摘要

语言不仅是沟通工具,更是人类认知和推理的媒介。如果语言相对论的观点所述,语言结构塑造了认知模式,那么在人类语言上训练的大型语言模型(LLM)也可能内化不同语言中嵌入的习惯性逻辑结构。为检验此假设,我们引入BICAUSE,一个用于因果推理的结构化双语数据集,包含前向和反向因果形式的中文和英文语料。我们的研究发现三个关键发现:(1) LLM表现出类型学一致的注意力模式,在中文中更关注原因和句子初始连词,而在英文中呈更均衡的分布。(2) 模型内化了语言特定的因果词序偏好,并常常僵化地将其应用于非典型输入,导致性能下降,尤其是在中文中。(3) 当因果推理成功时,模型的表示在不同语言中趋向于语义对齐的抽象,表明其超越表层形式的共同理解。总体而言,这些结果表明,LLM不仅模仿表层语言形式,还内化了由语言塑造的推理偏差。基于认知语言理论,这一现象首次通过对模型内部结构的分析进行了实证验证。

关键词

引用

@article{arxiv.2506.16151,
  title  = {Under the Shadow of Babel: How Language Shapes Reasoning in LLMs},
  author = {Chenxi Wang and Yixuan Zhang and Lang Gao and Zixiang Xu and Zirui Song and Yanbo Wang and Xiuying Chen},
  journal= {arXiv preprint arXiv:2506.16151},
  year   = {2025}
}

备注

15 pages, 10 figures