评估预训练模型与提示适应语言模型之间的性别偏见转移
计算与语言
2024-12-05 v1 人工智能
机器学习
摘要
大型语言模型(LLM)正变得越来越多地被适应以实现特定任务的任务性,以便在实际决策系统中部署。已有多项工作通过研究微调适应策略对模型公平性影响来研究偏见转移假设(BTH),发现预训练遮蔽语言模型的公平性对使用微调适应的模型公平性影响有限。在本工作中,我们将 BTH 的研究扩展到因果模型下的提示适应情形,因为提示是一种可访问且计算高效的在实际系统中部署模型的方式。在与前述工作不同的是,我们确立了预训练 Mistral、Falcon 和 Llama 模型中的内在偏见与相同模型进行零样本和少样本提示时的偏见高度相关(rho >= 0.94)。进一步,我们发现即使对 LLMs 进行特定提示以表现出公平或偏见行为,偏见转移仍保持高度相关(rho >= 0.92),且少样本长度和刻板印象组成都有所变化(rho >= 0.97)。我们的发现突显了在预训练 LLMs 确保其公平性的重要性,尤其是当它们后续用于通过提示适应执行下游任务时。
引用
@article{arxiv.2412.03537,
title = {Evaluating Gender Bias Transfer between Pre-trained and Prompt-Adapted Language Models},
author = {Natalie Mackraz and Nivedha Sivakumar and Samira Khorshidi and Krishna Patel and Barry-John Theobald and Luca Zappella and Nicholas Apostoloff},
journal= {arXiv preprint arXiv:2412.03537},
year = {2024}
}