中文

预训练语言模型表征中的性别编码模式

计算与语言 2025-03-11 v1 人工智能

摘要

预训练语言模型(PLM)中的性别偏见带来了重大的社会与伦理挑战。尽管人们的关注度日益增加,但对于不同模型如何在其内部表征并传播此类偏见,仍缺乏全面的研究。本研究采用信息论方法来分析各种基于编码器的架构中性别偏见是如何被编码的。我们重点关注三个方面:识别模型如何编码性别信息与偏见,考察偏见缓解技术与微调对已编码偏见及其有效性的影响,以及探究模型设计差异如何影响偏见的编码。通过严谨且系统的研究,我们的发现揭示了不同模型间普遍存在的性别编码模式。令人惊讶的是,去偏技术通常表现出有限的效用,有时在降低模型输出分布中偏见的同时,反而无意中增加了内部表征中的编码偏见。这凸显了缓解输出分布偏见与处理其内部表征之间的脱节。这项工作为推进偏见缓解策略和促进更公平的语言模型发展提供了宝贵指导。

关键词

引用

@article{arxiv.2503.06734,
  title  = {Gender Encoding Patterns in Pretrained Language Model Representations},
  author = {Mahdi Zakizadeh and Mohammad Taher Pilehvar},
  journal= {arXiv preprint arXiv:2503.06734},
  year   = {2025}
}

备注

Proceedings of the 5th Workshop on Trustworthy Natural Language Processing (TrustNLP 2025)