中文

训练过程中的公平性动态

计算与语言 2025-06-03 v1

摘要

我们研究了大型语言模型(LLM)训练过程中的公平性动态,以便通过提前停止等训练干预措施来诊断偏差并加以缓解;我们发现偏差可能会突然出现,且并不总是遵循常见的性能指标。我们引入了两个新指标,以在模型预训练期间全面评估公平性动态:平均排名和分部 Jensen-Shannon 散度。这些指标为 Pythia 模型在 WinoBias 数据集上对职业性别预测的偏差演变提供了深入见解。通过监测这些动态,我们发现:(1) Pythia-6.9b 偏向男性;在训练过程中,它预测“男性”的表现和信心均高于“女性”;(2) 通过提前停止,Pythia-6.9b 可以用 LAMBADA 上 1.7% 的准确率换取 92.5% 的公平性提升;(3) 更大的模型可能表现出更多偏差;即使未指定主语的性别,Pythia-6.9b 比 Pythia-160m 做出了更多关于性别的假设。

关键词

引用

@article{arxiv.2506.01709,
  title  = {Fairness Dynamics During Training},
  author = {Krishna Patel and Nivedha Sivakumar and Barry-John Theobald and Luca Zappella and Nicholas Apostoloff},
  journal= {arXiv preprint arXiv:2506.01709},
  year   = {2025}
}