通过机制解释性分析解码 LLM 中的道德偏见
计算与语言
2025-12-08 v2 人工智能
摘要
大型语言模型(LLM)已显示在 fine-tuning 过程中内化类人偏见,但偏见如何呈现机制尚不清晰。本文调查 Knobe 效应——一种意向性判断中的道德偏见——是否在 fine-tuned LLM 中出现,以及其是否可追溯至模型的特定组件。我们对 3 个开源 LLM 进行 Layer-Patching 分析,证明偏见不仅在 fine-tuning 期间学习,而且局限于特定层。令人惊讶的是,我们发现仅通过在关键层注入对应的 pretrained 模型激活,即可消除该效应。我们的发现提供了新证据表明,LLM 中的社交偏见可通过精准干预进行解释、局限化和缓解,无需重新训练模型。
引用
@article{arxiv.2510.12229,
title = {Analysing Moral Bias in Finetuned LLMs through Mechanistic Interpretability},
author = {Bianca Raimondi and Daniela Dalbagno and Maurizio Gabbrielli},
journal= {arXiv preprint arXiv:2510.12229},
year = {2025}
}
备注
Preprint. Under review