UniBias: 通过内部注意力与前馈网络操作揭示并缓解大语言模型偏见
计算与语言
2024-12-13 v2 人工智能
摘要
大语言模型(LLM)在利用上下文学习(ICL)范式处理各种任务时展现了令人印象深刻的能力。然而,其有效性常因固有偏见而受损,导致提示脆弱性,即对设计设置(如示例选择、顺序和提示格式)的敏感性。先前研究通过外部调整模型输出来解决LLM偏见,但导致此类偏见的内部机制仍未得到探索。我们的工作深入研究了这些机制,特别是探究了前馈神经网络(FFN)和注意力头如何导致LLM的偏见。通过解释单个FFN向量和注意力头的贡献,我们识别出使LLM预测偏向特定标签的有偏见的LLM组件。为缓解这些偏见,我们引入了UniBias,一种仅推理的方法,能有效识别并消除有偏见的FFN向量和注意力头。在12个NLP数据集上的大量实验表明,UniBias显著提升了ICL性能并缓解了LLM的提示脆弱性。
引用
@article{arxiv.2405.20612,
title = {UniBias: Unveiling and Mitigating LLM Bias through Internal Attention and FFN Manipulation},
author = {Hanzhang Zhou and Zijian Feng and Zixiao Zhu and Junlang Qian and Kezhi Mao},
journal= {arXiv preprint arXiv:2405.20612},
year = {2024}
}
备注
Accepted to NeurIPS 2024