LLM 中习语比喻义与字面义之间的博弈
计算与语言
2026-01-19 v5 人工智能
摘要
习语由于其非组合性的比喻义通常与字面义存在巨大差异,对语言模型构成了独特的挑战。在本文中,我们采用因果追踪系统地分析预训练因果 Transformer 如何处理这种歧义。我们定位了三种机制: 早期子层和特定的注意力头检索习语的比喻义,同时抑制其字面义; 当消歧上下文出现在习语之前时,模型从最早的层开始利用该上下文,如果上下文与检索到的解释相冲突,后续层会对其进行细化; 随后,选择性且相互竞争的通路承载这两种解释:一条中间通路优先处理比喻义,一条并行的直接通路偏向字面义,从而确保两种解读均保持可用。我们的发现为自回归 Transformer 中的习语理解提供了机制性证据。
引用
@article{arxiv.2506.01723,
title = {Tug-of-war between idioms' figurative and literal interpretations in LLMs},
author = {Soyoung Oh and Xinting Huang and Mathis Pink and Michael Hahn and Vera Demberg},
journal= {arXiv preprint arXiv:2506.01723},
year = {2026}
}