菲律宾语言模型中的偏见归因:为冠状词构词法语言扩展偏见可解释性度量
计算与语言
2025-08-29 v1
摘要
新兴的偏见归因和可解释性研究揭示了标记如何导致处理英文文本的语言模型产生偏见。我们在此基础上进一步探索,通过为实现处理冠状词构词法语言(特别是菲律宾语)的模型调整信息论偏见归因得分度量。我们然后通过在纯菲律宾模型上以及三个多语言模型上使用它来演示所采用方法的有效性。这三个多语言模型分别是在全球语言和东南亚数据上训练的。我们的结果显示,菲律宾模型受单词驱动,这些单词涉及人物、物体和关系,实体主题与英语(即犯罪、性行为和社会行为)中的行动主题相区别。这些发现指向了英语和非英语模型在处理与社会人口统计学相关联的输入时,如何链接到偏见的差异。
引用
@article{arxiv.2506.07249,
title = {Bias Attribution in Filipino Language Models: Extending a Bias Interpretability Metric for Application on Agglutinative Languages},
author = {Lance Calvin Lim Gamboa and Yue Feng and Mark Lee},
journal= {arXiv preprint arXiv:2506.07249},
year = {2025}
}
备注
Accepted into the Gender Bias in NLP Workshop at ACL 2025 (GeBNLP@ACL2025)