解释语言模型偏见的新型可解释性指标:针对东南亚多语言模型的应用
计算与语言
2025-06-10 v2
摘要
关于预训练语言模型 (PLM) 中的偏见研究聚焦于偏差评估与缓解,却未能解决偏差归因与可解释性的问题。我们提出了一种新型指标——偏差归因得分 (bias attribution score),该指标源自信息论,用于衡量 PLM 中 token 级别对偏差行为的贡献。随后我们通过将其应用于多语言 PLM,包括尚未在偏差评估文献中得到充分考察的东南亚模型,展示了该指标的实用性。我们的结果确认了东南亚 PLM 中存在性别歧视和同性恋偏见。解释性和语义分析也揭示,PLM 偏差强烈由与犯罪、亲密关系和帮助等话题相关的词语诱导,表明这些是 PLM 强烈再生产来自预训练数据的偏见的主题,以及 PLM 应在更谨慎地使用时应加以注意的领域。
引用
@article{arxiv.2410.15464,
title = {A Novel Interpretability Metric for Explaining Bias in Language Models: Applications on Multilingual Models from Southeast Asia},
author = {Lance Calvin Lim Gamboa and Mark Lee},
journal= {arXiv preprint arXiv:2410.15464},
year = {2025}
}
备注
Accepted for oral presentation at PACLIC 38 (38th Pacific Asia Conference on Language, Information, and Computation)