诊断道德对齐中的性能权衡:以性别刻板印象为案例研究
计算与语言
2025-11-21 v3
摘要
道德对齐已成为调节预训练语言模型(PLM)行为的广泛采用方法,通常通过对精心策划的数据集进行微调来实现。性别刻板印象缓解是道德对齐更广泛应用中的一个表征任务。然而,这一过程常常以降级下游任务性能为代价。先前的研究通常旨在通过鼓励 PLM 仅选择性遗忘刻板知识(同时保持其语言建模能力,即整体遗忘)来实现性能权衡。在这篇短文中,我们从遗忘和公平性目标的视角探讨这种性能权衡是否可以实现。我们的分析表明,实现令人满意的公平性所需的大规模数据集凸显了当前公平性目标在实现有效权衡方面的局限性:(1) 下游任务性能与整体遗忘高度相关;(2) 选择性遗忘减少了刻板印象,但整体遗忘增加;(3) 缓解遗忘的通用方法无法有效减少整体遗忘,也未能改善下游任务性能。
引用
@article{arxiv.2509.21456,
title = {Diagnosing the Performance Trade-off in Moral Alignment: A Case Study on Gender Stereotypes},
author = {Guangliang Liu and Bocheng Chen and Han Zi and Xitong Zhang and Kristen Marie Johnson},
journal= {arXiv preprint arXiv:2509.21456},
year = {2025}
}