注意力头中的偏见?基于 Transformer 的语言模型注意力头的偏见分析
计算与语言
2024-06-18 v2
摘要
基于 Transformer 的预训练大语言模型(PLM),如 BERT 和 GPT,已在 NLP 任务中取得显著成功。然而,PLM 易于编码刻板偏见。尽管关于 PLM 中刻板偏见缓解的文献不断涌现,例如去偏见性别与种族刻板印象的工作,此类偏见如何在 PLM 内部显现与表现仍大体未知。理解内部刻板机制或可更好地评估模型公平性,并指导有效缓解策略的开发。本工作中,我们聚焦于注意力头——Transformer 架构的主要组成部分——并提出一个偏见分析框架,以探索并识别出一小部分被发现对 PLM 的刻板偏见有贡献的偏见头。我们进行了大量实验来验证这些偏见头的存在并更好地理解其行为。我们考察了两类基于 Transformer 的 PLM 中英语的性别与种族偏见:编码器式的 BERT 模型与解码器式的自回归 GPT 模型。总体而言,结果有助于理解预训练语言模型中的偏见行为。
引用
@article{arxiv.2311.10395,
title = {Bias A-head? Analyzing Bias in Transformer-Based Language Model Attention Heads},
author = {Yi Yang and Hanyu Duan and Ahmed Abbasi and John P. Lalor and Kar Yan Tam},
journal= {arXiv preprint arXiv:2311.10395},
year = {2024}
}
备注
14 pages, 7 figures, 3 tables including references and appendices