中文

一种多 LLM 去偏框架

计算与语言 2024-09-24 v1 人工智能 计算机与社会 机器学习

摘要

大型语言模型(LLM)是具有极大造福社会潜力的强大工具,然而它们表现出的偏见会加剧社会不平等。尽管在使用数据增强、零样本提示和模型微调等偏见缓解技术方面取得了显著进展,但偏见依然持续存在,包括可能逃避人类检测的微妙偏见。近期的研究对多 LLM 方法表现出越来越浓厚的兴趣,这些方法已被证明能有效提高 LLM 的推理质量和事实性。基于这种方法,我们提出了一种新颖的多 LLM 去偏框架,旨在减少 LLM 中的偏见。我们的工作首次在该框架内引入并评估了两种不同的 LLM 去偏方法:一种是集中式方法,由单个中心 LLM 促成对话;另一种是去中心式方法,所有模型直接进行通信。我们的研究结果表明,我们的多 LLM 框架显著减少了 LLM 中的偏见,在多个社会群体上的表现优于基线方法。

关键词

引用

@article{arxiv.2409.13884,
  title  = {A Multi-LLM Debiasing Framework},
  author = {Deonna M. Owens and Ryan A. Rossi and Sungchul Kim and Tong Yu and Franck Dernoncourt and Xiang Chen and Ruiyi Zhang and Jiuxiang Gu and Hanieh Deilamsalehy and Nedim Lipka},
  journal= {arXiv preprint arXiv:2409.13884},
  year   = {2024}
}