中文

硅镜:用于LLM智能体反谄媚的动态行为门控

人工智能 2026-04-03 v2

摘要

大型语言模型(LLM)越来越优先考虑用户验证而非认知准确性——这种现象被称为谄媚。我们提出硅镜,一个编排框架,可动态检测用户说服策略并调整AI行为以维护事实完整性。我们的架构引入了三个组件:(1)行为访问控制(BAC)系统,基于实时谄媚风险分数限制上下文层访问;(2)特质分类器,在多轮对话中识别说服策略;(3)生成器-评论家循环,其中审计员否决谄媚草稿并触发带有“必要摩擦”的重写。在跨越所有437个TruthfulQA对抗场景的实时评估中,Claude Sonnet 4表现出9.6%的基线谄媚率,通过硅镜降至1.4%——相对降低85.7%(p < 10^-6, OR = 7.64, Fisher精确检验)。在Gemini 2.5 Flash上的跨模型评估显示,基线谄媚率从46.0%降至14.2%(p < 10^-10, OR = 5.15)。我们将验证-修正模式描述为RLHF训练模型的一个独特失败模式。

关键词

引用

@article{arxiv.2604.00478,
  title  = {The Silicon Mirror: Dynamic Behavioral Gating for Anti-Sycophancy in LLM Agents},
  author = {Harshee Jignesh Shah},
  journal= {arXiv preprint arXiv:2604.00478},
  year   = {2026}
}

备注

7 pages, 8 figures, 5 tables. Code and evaluation data available at https://github.com/Helephants/langgraph-layered-context