中文

开发安全负责的大型语言模型:在偏好减少与语言理解之间寻求平衡?

计算与语言 2025-01-07 v5

摘要

大型语言模型(LLMs)已在文本生成、翻译等众多自然语言处理任务中取得进展。然而,这些模型常常生成可能延续偏见的文本。现有的偏差缓解方法通常会牺牲知识保留。本研究探讨了大型语言模型能否在不牺牲知识或理解能力的情况下生成安全、无偏见的输出。我们引入了安全负责大型语言模型(Safe and Responsible Large Language Model, SRLLM_\text{LLM}),其在已安全微调的自回归解码器-only LLM 之上进行指令微调,以减少生成文本中的偏见。我们开发了一套专业数据集,包含不安全及其对应的安全变体示例,用于训练 SRLLM_\text{LLM} 以识别和纠正有偏见的文本。在我们的专业数据集和分布外测试集上的实验表明,SRLLM_\text{LLM} 有效减少了偏见,同时保持了知识的完整性。该性能优于对较小语言模型和仅依赖提示技巧的基础 LLM 进行的传统微调。我们的发现表明,针对诸如消除偏见等任务定制化数据集上的指令微调是一种高效策略,可在保留 LLM 内在知识和能力的同时最小化其中的偏见。代码和数据集可在 https://github.com/shainarazavi/Safe-Responsible-LLM 上获取。

关键词

引用

@article{arxiv.2404.01399,
  title  = {Developing Safe and Responsible Large Language Model : Can We Balance Bias Reduction and Language Understanding in Large Language Models?},
  author = {Shaina Raza and Oluwanifemi Bamgbose and Shardul Ghuge and Fatemeh Tavakol and Deepak John Reji and Syed Raza Bashir},
  journal= {arXiv preprint arXiv:2404.01399},
  year   = {2025}
}