中文

LLM 中习语比喻义与字面义之间的博弈

计算与语言 2026-01-19 v5 人工智能

摘要

习语由于其非组合性的比喻义通常与字面义存在巨大差异,对语言模型构成了独特的挑战。在本文中,我们采用因果追踪系统地分析预训练因果 Transformer 如何处理这种歧义。我们定位了三种机制: 早期子层和特定的注意力头检索习语的比喻义,同时抑制其字面义; 当消歧上下文出现在习语之前时,模型从最早的层开始利用该上下文,如果上下文与检索到的解释相冲突,后续层会对其进行细化; 随后,选择性且相互竞争的通路承载这两种解释:一条中间通路优先处理比喻义,一条并行的直接通路偏向字面义,从而确保两种解读均保持可用。我们的发现为自回归 Transformer 中的习语理解提供了机制性证据。

关键词

引用

@article{arxiv.2506.01723,
  title  = {Tug-of-war between idioms' figurative and literal interpretations in LLMs},
  author = {Soyoung Oh and Xinting Huang and Mathis Pink and Michael Hahn and Vera Demberg},
  journal= {arXiv preprint arXiv:2506.01723},
  year   = {2026}
}