中文

大语言模型中的冲突与一致性效应:言语冲突任务中的权重内与上下文内竞争

神经元与认知 2026-08-11 v1 人工智能

摘要

一致性效应在Stroop和flanker等冲突任务中被观察到,在心理学和神经科学中已被研究了近一个世纪,但其机制基础尚未完全理解。我们引入了一个纯言语的LLM冲突任务,其中提示词干引发默认的同色补全,而显式规则要么与补全一致(一致条件),要么与补全冲突(冲突条件)。Gemma-2-2B和六个参数量从410M到12B不等的Pythia模型表现出强烈的默认同色倾向,且七个模型中有六个表现出强烈的一致性效应。使用因果归因分析、注意力分析和注意力消融,我们在这些LLM中识别出不同的处理路径:一条涉及对表面颜色线索的短程注意力的路径,在一致条件下被优先激活;另一条涉及对规则前缀的长程注意力的路径,在冲突条件下被优先激活。强化默认同色倾向的微调对任务条件产生了分化效应,在提高一致条件性能的同时降低了冲突条件的性能。相比之下,增加规则集大小选择性地损害了冲突条件的性能。这些汇聚的发现支持了一种解释,即该任务中的一致性效应源于权重内默认映射与上下文内基于规则的映射之间的竞争。更广泛地说,我们的发现说明了LLM如何作为模型系统,用于在单一学习网络内对默认响应倾向与规则支配响应倾向之间竞争的机制分析。

关键词

引用

@article{arxiv.2608.11510,
  title  = {Conflict and Congruency Effects in Large Language Models: In-Weight and In-Context Competition in a Verbal Conflict Task},
  author = {Xiaoyang Hu and Mike Angstadt and Shane Storks and Zan Huang and Aman Taxali and Alex Weigard and Richard L. Lewis and Chandra Sripada},
  journal= {arXiv preprint arXiv:2608.11510},
  year   = {2026}
}

备注

23 pages, 8 figures