中文

通过机制解释性分析解码 LLM 中的道德偏见

计算与语言 2025-12-08 v2 人工智能

摘要

大型语言模型(LLM)已显示在 fine-tuning 过程中内化类人偏见,但偏见如何呈现机制尚不清晰。本文调查 Knobe 效应——一种意向性判断中的道德偏见——是否在 fine-tuned LLM 中出现,以及其是否可追溯至模型的特定组件。我们对 3 个开源 LLM 进行 Layer-Patching 分析,证明偏见不仅在 fine-tuning 期间学习,而且局限于特定层。令人惊讶的是,我们发现仅通过在关键层注入对应的 pretrained 模型激活,即可消除该效应。我们的发现提供了新证据表明,LLM 中的社交偏见可通过精准干预进行解释、局限化和缓解,无需重新训练模型。

关键词

引用

@article{arxiv.2510.12229,
  title  = {Analysing Moral Bias in Finetuned LLMs through Mechanistic Interpretability},
  author = {Bianca Raimondi and Daniela Dalbagno and Maurizio Gabbrielli},
  journal= {arXiv preprint arXiv:2510.12229},
  year   = {2025}
}

备注

Preprint. Under review