检测大语言模型中的偏见:基于KcBERT的微调方法
计算与语言
2024-03-19 v1
摘要
大语言模型(LLM)的快速发展使其在自然语言处理方面具备类似人类的能力,正在被广泛应用于教育、医疗等多个社会领域。尽管这些模型的应用范围广泛,但它们有可能生成主观且规范性的语言,导致在社交群体之间出现歧视性对待或结果,尤其是由于网络攻击性语言。在本文中,我们将此类伤害定义为社会偏见,并通过基于模板的遮蔽语言模型(MLM)方法,对使用KcBERT和KOLD数据微调的模型中的民族、性别和种族偏见进行评估。为定量评估偏见,我们采用LPBS和CBS指标。与原始KcBERT相比,微调后的模型在民族偏见方面有所降低,但在性别和种族偏见方面表现出显著变化。基于这些结果,我们提出两种方法来缓解社会偏见。首先,在预训练阶段采用数据平衡方法,通过调整特定词汇出现次数的分布并将周围的有害词汇转换为非有害词汇来实现数据均匀性。其次,在训练阶段应用去偏正则化,通过调整dropout和正则化参数,确认训练损失降低。我们的贡献在于表明,由于语言依赖性特征,韩语语言模型中存在社会偏见。
引用
@article{arxiv.2403.10774,
title = {Detecting Bias in Large Language Models: Fine-tuned KcBERT},
author = {J. K. Lee and T. M. Chung},
journal= {arXiv preprint arXiv:2403.10774},
year = {2024}
}
备注
14 pages, 5 figures