BabyLM 中的偏见动态:迈向民主化预训练去偏的计算高效沙盒
计算与语言
2026-01-16 v2 人工智能
摘要
在过去几年中,预训练语言模型 在社会采用度和训练成本上均大幅增长。这种规模的快速增长制约了在理解和缓解其偏见方面的进展。由于重新训练 LM 的成本过高,大多数去偏工作集中在事后或基于掩码的策略上,这些策略通常未能解决偏见的根本原因。在这项工作中,我们寻求通过使用低成本代理模型来民主化预训练阶段的去偏研究。具体而言,我们研究了 BabyLM,即在小型且可变的语料库上训练的紧凑型类 BERT 模型,它们能够近似大型模型的偏见获取和学习动态。我们表明,尽管 BabyLM 的规模大幅缩小,但其内在偏见形成和性能发展模式与标准 BERT 模型表现出高度一致。此外,BabyLM 和 BERT 之间的相关性在多种模型内和模型后去偏方法中均成立。利用这些相似性,我们使用 BabyLM 进行了预训练阶段的去偏实验,重现了先前的发现,并提出了关于性别失衡和毒性对偏见形成影响的新见解。我们的结果表明,BabyLM 可以作为大型 LM 的有效沙盒,将预训练成本从超过 500 GPU 小时降低到 30 GPU 小时以内。这为民主化预训练阶段的去偏研究提供了一种途径,并能够更快、更易得地探索构建更公平 LM 的方法。
引用
@article{arxiv.2601.09421,
title = {Bias Dynamics in BabyLMs: Towards a Compute-Efficient Sandbox for Democratising Pre-Training Debiasing},
author = {Filip Trhlik and Andrew Caines and Paula Buttery},
journal= {arXiv preprint arXiv:2601.09421},
year = {2026}
}
备注
21 pages, 18 figures