从 n-gram 到注意力:模型架构如何学习和传播语言模型中的偏见
计算与语言
2025-11-14 v2 人工智能
摘要
当前关于语言模型(LM)偏见的研究主要关注数据质量,对模型架构以及数据时间影响的注意力显著不足。更关键的是,鲜有研究系统性地探讨偏见的来源。我们提出一种基于比较行为理论的方法,用于解释训练数据与模型架构在语言建模期间偏见传播之间复杂的相互作用。基于最近将 transformer 与 n-gram LM 相关的工作,我们评估数据、模型设计选择和时间动态如何影响偏见传播。我们的发现揭示了:(1)n-gram LM 对上下文窗口大小在偏见传播方面高度敏感,而 transformer 表现出建构性鲁棒性;(2)训练数据的时间性来源显著影响偏见;(3)不同的模型架构对受控偏见注入作出差异反应,其中某些偏见(例如性取向)被放大得显著。随着语言模型变得无处不在,我们的发现凸显了需要一种整体方法——从数据和模型两个维度追溯偏见的来源,不仅仅是症状,以缓解伤害的必要性。
引用
@article{arxiv.2505.12381,
title = {From n-gram to Attention: How Model Architectures Learn and Propagate Bias in Language Modeling},
author = {Mohsinul Kabir and Tasfia Tahsin and Sophia Ananiadou},
journal= {arXiv preprint arXiv:2505.12381},
year = {2025}
}
备注
Accepted at EMNLP 2025 (Findings)