中文

针对大语言模型中刻板印象的隐性冲突监测机制建模

社会与信息网络 2026-05-12 v1

摘要

本文研究大语言模型(LLM)中针对刻板印象内容的涌现式自我去偏机制。传统安全机制主要由显式的输入级刺激触发,与之不同的是,自我去偏机制可涉及生成时的内在纠正,且无法直接归约为表层提示。受认知神经科学中冲突监测与反应抑制理论的启发,我们提出 COCO,一种对比因果方法,旨在识别 COCO 神经元——这类神经元在对立的生成响应(如刻板印象输出与无偏输出)之间表现出高内部一致性(intra-\underline{CO}nsistency)与急剧的相互对比(inter-\underline{CO}ntrast)。消融研究表明,停用 COCO 神经元会导致模型公平性灾难性崩溃;超过 90% 的输出恢复为有偏内容,远超显式对抗越狱攻击所引发的偏见水平。观察到对 COCO 神经元进行简单的权重放大仅带来边际收益,我们提出两种免训练的轻量级编辑策略:局部增强(LE-COCO)与网络化增强(NE-COCO)。综合评估表明,我们的方法增强了对对抗越狱的鲁棒性,并在开放式安全基准上取得强劲表现,同时保持了基础的生成能力。尽管本研究主要针对社会刻板印象,但 COCO 机制在幻觉检测等多样领域具有显著潜力,可为自我进化 AI 智能体的发展提供宝贵见解。

关键词

引用

@article{arxiv.2605.09647,
  title  = {Modeling Implicit Conflict Monitoring Mechanisms against Stereotypes in LLMs},
  author = {Jingshen Zhang and Bo Wang and Yanlin Fu and Dongming Zhao and Ruifang He and Yuexian Hou and Zifei Yu},
  journal= {arXiv preprint arXiv:2605.09647},
  year   = {2026}
}