旧习难改:对话历史在LLM几何陷阱中的影响
计算与语言
2026-05-19 v2 人工智能
摘要
大语言模型(LLM)的对话历史如何影响其后续表现?近期研究表明,LLM会被其对话历史以意想不到的方式所影响。例如,先前交互中的幻觉可能影响后续模型响应。本文引入History-Echoes框架,以探究对话历史对后续生成的偏置。该框架从两个角度进行分析:从概率论角度,我们将对话建模为马尔可夫链,以量化状态一致性;从几何学角度,我们度量连续隐藏表示的一致性。在覆盖多样化现象的六个数据集上测试了三个模型家族,分析结果显示,两个角度之间存在强烈相关性。通过联合这两个角度,我们展示行为持续性表现为几何陷阱,其中在潜在空间中的间隙将限制模型轨迹。代码已公开于 https://github.com/technion-cs-nlp/OldHabitsDieHard。
引用
@article{arxiv.2603.03308,
title = {Old Habits Die Hard: How Conversational History Geometrically Traps LLMs},
author = {Adi Simhi and Fazl Barez and Martin Tutek and Yonatan Belinkov and Shay B. Cohen},
journal= {arXiv preprint arXiv:2603.03308},
year = {2026}
}
备注
Accepted to ICML 2026