大型语言模型中的偏见解释:基于特征的方法
计算与语言
2024-06-19 v1
摘要
大型语言模型(LLM)如 Mistral 和 LLaMA 在 various natural language processing(NLP)任务中展现出惊人的性能。尽管如此,这些模型继承了 diverse 数据集中所包含的社会偏见。本文通过一种新颖的基于特征的分析方法,探讨了 LLM 中偏见的传播。drawing inspiration from causal mediation analysis,我们假设 bias-related features 的演变,并通过解释性技术(如激活和归因补丁)进行验证。我们的贡献有三个:(1)我们提出并经验验证了一种用于 LLM 中偏见分析的方法,应用在 LLaMA-2-7B、LLaMA-3-8B 和 Mistral-7B-v0.3 上,使用来自职业数据集的模板。(2)我们将该方法扩展到另一种性别偏见,展示了其通用性。(3)我们区分了 MLPs 和注意力头在偏见传播中的作用,并实现了针对性去偏。我们的发现揭示了 LLM 中偏见的复杂性,并强调了针对性去偏策略的必要性,提供了对偏见机制及其有效缓解途径的更深入理解。
引用
@article{arxiv.2406.12347,
title = {Interpreting Bias in Large Language Models: A Feature-Based Approach},
author = {Nirmalendu Prakash and Lee Ka Wei Roy},
journal= {arXiv preprint arXiv:2406.12347},
year = {2024}
}