中文

促进大型语言模型中的平等性:基于贝叶斯理论识别与缓解隐性偏见

计算与语言 2024-08-21 v1 人工智能

摘要

大型语言模型 (LLMs) 在广泛文本语料库上进行训练,这些语料库不可避免地包含偏见信息。尽管诸如情感对齐 (Affective Alignment) 等技术可以缓解这些偏见的部分负面影响,但现有的基于提示的攻击方法仍可从模型权重中提取这些偏见。此外,当 LLMs 被提示在不同人口统计群体上执行相同任务时,这些偏见常常以微妙的方式出现,从而掩盖了其存在。为解决这一问题,我们正式定义了隐性偏见问题,并开发了一种基于贝叶斯理论的创新偏见消除框架——基于贝叶斯理论的偏见消除 (BTBR)。BTBR 利用似然比筛选来定位公开可访问的偏见数据集中那些在 LLM 训练阶段被无意纳入的偏见数据条目。然后,它自动构建相关的知识三元组,并使用模型编辑技术从 LLMs 中清除偏见信息。通过大量实验,我们确认了 LLMs 中隐性偏见问题的存在,并验证了我们 BTBR 方法的有效性。

关键词

引用

@article{arxiv.2408.10608,
  title  = {Promoting Equality in Large Language Models: Identifying and Mitigating the Implicit Bias based on Bayesian Theory},
  author = {Yongxin Deng and Xihe Qiu and Xiaoyu Tan and Jing Pan and Chen Jue and Zhijun Fang and Yinghui Xu and Wei Chu and Yuan Qi},
  journal= {arXiv preprint arXiv:2408.10608},
  year   = {2024}
}