中文

她甚至相关吗?当 BERT 忽略显式性别线索时

计算与语言 2026-05-11 v1

摘要

性别偏见在大型语言模型中主要针对英语进行研究,而带有语法或形态性别标记的语言则相对缺乏研究。本文调查了性别信息在从零开始训练的 Dutch BERT 模型中的出现方式与时机,提供了变形 Transformer 架构针对结合显性形态性别标记与通用形式的语言进行 checkpoint 级别偏差形成分析。通过提取训练期间的上下文嵌入,我们构建动态性别子空间以追踪性别何时被线性编码以及该编码如何随时间演化。上下文嵌入常被假设为能稳健地整合上下文线索,从而允许模型根据更局部的使用情况调整单词的表示。因此,我们测试了显式性别线索在受控句子模板中的覆盖能力(例如 Zij is een loodgieter ('她是一名管家'))是否能覆盖学习的统计关联(plumber -> 男性)。我们的发现挑战了这一假设:尽管性别在大约第 20 个 epoch 明显可线性分离且分布在多个嵌入维度上,但该模型在面对短句子模板中的显式上下文线索时难以更新其内部性别表示。统计性别-职业配对被预测得更准确,而反统计性别配对则更不准确,荷兰语中的通用形式系统性地默认为男性解释,即使上下文明确指明女性指称亦然。总体而言,我们的结果似乎表明,Dutch BERT 模型在所探测的性别方向上所学习的表示的 contextualization 并不足够动态:在反统计性别情境中的显式性别线索未能可靠地反映在结果表示中,导致持久的男性默认行为。

关键词

引用

@article{arxiv.2605.07622,
  title  = {Is She Even Relevant? When BERT Ignores Explicit Gender Cues},
  author = {Jonas Klein and Chiara Manna and Eva Vanmassenhove},
  journal= {arXiv preprint arXiv:2605.07622},
  year   = {2026}
}