模型合并算法社会偏差缓解的实证调查
计算与语言
2025-12-03 v1 人工智能
摘要
大型语言模型 (LLMs) 已知会继承甚至放大其预训练语料库中存在的社会偏见,这威胁公平性和社会信任。为此,近期研究探索了通过模型合并方法来“编辑”LLM 参数以缓解社会偏见;然而,目前尚无实证比较。本文对七种算法进行实证调查:Linear、Karcher Mean、SLERP、NuSLERP、TIES、DELLA 和 Nearswap,在GPT、LLaMA和Qwen系列中应用13个开放权重模型。我们使用三个偏见数据集 (BBQ、BOLD 和 HONEST) 进行全面评估,并衡量这些技术对LLM在SuperGLUE基准任务中的下游性能影响。我们发现偏见减轻与下游性能之间的权衡:实现更大偏见缓解的方法会降低准确率,尤其是那些需要阅读理解和常识性及因果推理的任务。就合并算法而言,Linear、SLERP 和 Nearswap 持续地在减轻偏见的同时保持整体性能,其中在中等插值权重下 SLERP 表现为最佳平衡选择。这些结果凸显了模型合并算法在偏差缓解方面的潜力,同时表明过度去偏差或不恰当的合并方法可能导致重要语言能力的降低。
引用
@article{arxiv.2512.02689,
title = {An Empirical Survey of Model Merging Algorithms for Social Bias Mitigation},
author = {Daiki Shirafuji and Tatsuhiko Saito and Yasutomo Kimura},
journal= {arXiv preprint arXiv:2512.02689},
year = {2025}
}
备注
Accepted in PACLIC 2025