中文

因果舌踢:LLM 能编码因果方向,但其 Yes/No 输出未能表达

计算与语言 2026-05-26 v1 人工智能

摘要

我们发现大语言模型在编码关于因果问题的信息与其回答内容存在不匹配。在反常识 CLadder 条目中,固定的线性探针可从模型隐藏状态中恢复出 evidence-supported 的答案(准确率约为 0.97),而 spoken Yes/No 答案则回归到常识答案(准确率约为 0.5)。我们称这个约 +0.5 的差距为因果舌踢:一种错误的 Yes/No 回答可分解为两个可分离的失败模式:要么没有内部信号,要么是 verbal 接口无法表达的信号。这一发现对仅基于输出的因果基准具有双重含义:一个标为“正确”的基准未必意味着模型已理解,而一个标为“错误”的基准也未必意味着模型不能。关于 LLM 是否能进行因果推理的 sweeping 论断,仅凭单一准确率数字就值得再审视。

关键词

引用

@article{arxiv.2605.25891,
  title  = {Causal Tongue-Tie: LLMs Can Encode Causal Direction, But Their Yes/No Outputs Fail to Express},
  author = {Ziyi Ding and Xiao-Ping Zhang},
  journal= {arXiv preprint arXiv:2605.25891},
  year   = {2026}
}