MBIAS:在保持上下文的同时减轻大语言模型中的偏见
计算与语言
2024-07-01 v3
摘要
大语言模型在多样化应用中的部署需要确保安全,同时不损害生成内容的上下文完整性。传统方法(包括安全性特定微调或对抗测试)常常在牺牲上下文含义方面实现安全输出。这可能导致无法处理偏见和有害性的细微方面,如不同人口统计学中 underrepresented 或负面呈现。为解决这些挑战,我们引入MBIAS,一个在专为安全干预设计的自定义数据集上进行指令微调的LLM框架。MBIAS旨在显著减少LLM输出中的偏见和有害元素,同时保留主要信息。本 work 还详细说明了我们进一步使用LLM:在人类监督下作为标注者以及作为生成内容的评估者。经验分析显示,MBIAS在标准评估中将偏见和有害性减少30%以上,在 diverse demographic 测试中减少90%以上,凸显了我们方法的鲁棒性。我们将数据集和微调模型公开于研究社区,以便进一步调查并确保可重复性。该项目的代码可在 https://github.com/shainarazavi/MBIAS/tree/main 访问。警告:本文包含可能令人 offense 或令人不安的示例。
引用
@article{arxiv.2405.11290,
title = {MBIAS: Mitigating Bias in Large Language Models While Retaining Context},
author = {Shaina Raza and Ananya Raval and Veronica Chatrath},
journal= {arXiv preprint arXiv:2405.11290},
year = {2024}
}