预训练与下游场景在偏差评估与去偏中的差距
计算与语言
2024-01-17 v1
摘要
预训练语言模型(PLM)的输出倾向在微调(FT)前后因模型参数更新而发生显著变化。这些输出倾向的差异导致了PLM社会偏见中的差距。例如,在基于FT的去偏方法下,PLM的内在偏差分数与其外在偏差分数之间存在低相关性。此外,对PLM应用基于FT的去偏方法会导致下游任务性能下降。另一方面,在大规模数据集上训练的PLM可以通过使用提示的上下文学习(ICL)在不更新参数的情况下进行学习。与基于FT的去偏方法相比,ICL对PLM引起的改变更小。因此,我们假设在预训练和FT模型中观察到的差距对于使用ICL的去偏方法并不成立。在本研究中,我们证明与基于FT的方法相比,基于ICL的去偏方法在内在和外在偏差分数之间显示出更高的相关性。而且,与FT情况相比,ICL情况下因去偏导致的性能下降也更小。
引用
@article{arxiv.2401.08511,
title = {The Gaps between Pre-train and Downstream Settings in Bias Evaluation and Debiasing},
author = {Masahiro Kaneko and Danushka Bollegala and Timothy Baldwin},
journal= {arXiv preprint arXiv:2401.08511},
year = {2024}
}