中文

超越表层结构:LLM理解能力的因果评估

计算与语言 2024-12-02 v1 人工智能

摘要

大型语言模型(LLM)在自然语言任务中展现出惊人的能力,但关于它们是否真正理解深层结构(即核心语义)或仅依赖表层结构(例如呈现格式)的争论仍持续存在。先前的研究观察到LLM在对表层结构干预时性能下降,认为其成功依赖于表层结构识别。然而,表层结构敏感性并不妨碍深层结构的理解。严格评估LLM的能力需要同时分析两者,但深层结构常被忽视。在此基础上,我们采用因果中介分析来评估LLM的理解能力,以充分发现其使用深层和表层结构的能力。具体而言,我们将深层结构的理解建模为直接因果效应(Direct Causal Effect, DCE),将表层结构的理解建模为间接因果效应(Indirect Causal Effect, ICE)。为了解决原始DCE和ICE不可估计的问题——源于不可能隔离深层和表层结构的相互影响——我们开发了相应的可量化替代方案,包括近似DCE(Approximated DCE, ADCE)和近似ICE(Approximated ICE, AICE)。我们进一步应用ADCE来评估一系列主流LLM,结果显示大多数LLM都表现出深层结构理解能力,这种能力随预测准确率的增长而增长。比较ADCE和AICE表明,封闭源LLM更依赖深层结构,而开源LLM更依赖表层结构,这种依赖随模型规模的增大而减弱。理论而言,ADCE是一种双向评估,既衡量深层结构变化对输出变化的充分性,也衡量必要性,从而比LLM中常见的准确率评估提供了更全面的评估。我们的工作为LLM的深层结构理解提供了新见解,并为LLM评估提供了新方法。

关键词

引用

@article{arxiv.2411.19456,
  title  = {Beyond Surface Structure: A Causal Assessment of LLMs' Comprehension Ability},
  author = {Yujin Han and Lei Xu and Sirui Chen and Difan Zou and Chaochao Lu},
  journal= {arXiv preprint arXiv:2411.19456},
  year   = {2024}
}

备注

28 pages, 14 figures, 10 tables