中文

自愈明与反事实自模拟缓解大语言模型中的偏见与迎合现象

计算与语言 2026-01-22 v1 人工智能 计算机与社会

摘要

公正的决策需要忽略不相关的、可能具有偏见的信息。为此,决策者需要近似他们若未知晓某些事实(如求职者的性别或种族)将做出的决策。这一反事实自模拟对人类而言极其困难,即使是善意的行为者也会产生偏见。我们展示了大型语言模型(LLM)在近似在反事实知识下所作决定的能力方面也存在类似限制,即在抵消偏置和克服迎合现象方面。我们表明,要求模型忽略或假装不知晓偏见信息的提示措施无法抵消这些偏见,甚至时而适得其反。然而,与人类不同,LLM可获得其自身反事认知的真实模型——其自身API。我们表明,获得自我盲化副本的响应,能够实现更公平的决策,同时提供更大的透明度,以区分隐式偏见与有意偏见行为。

关键词

引用

@article{arxiv.2601.14553,
  title  = {Self-Blinding and Counterfactual Self-Simulation Mitigate Biases and Sycophancy in Large Language Models},
  author = {Brian Christian and Matan Mazor},
  journal= {arXiv preprint arXiv:2601.14553},
  year   = {2026}
}