AXOLOTL:通过辅助自去偏实现大语言模型输出的公平性
计算与语言
2024-03-04 v1 人工智能
计算机与社会
机器学习
摘要
预训练大语言模型(LLM)显著提升了自然语言处理能力,但易受训练数据中偏见的影响,导致 various 应用中出现不公平结果。尽管已提出多种缓解偏见的策略,但它们通常需要大量计算资源,且可能损害模型性能。本文介绍了 AXOLOTL,一种新颖的后处理框架,该框架跨任务和模型无关地运行,利用公共 API 与大语言模型交互而无需直接访问内部参数。通过类似零样本学习的三步过程,AXOLOTL 识别偏见、提出解决方案并引导模型对其输出进行自去偏。这种方法最小化了计算成本并保留了模型性能,使 AXOLOTL 成为一款具有广泛适用性和易用性的 LLM 输出去偏工具。
引用
@article{arxiv.2403.00198,
title = {AXOLOTL: Fairness through Assisted Self-Debiasing of Large Language Model Outputs},
author = {Sana Ebrahimi and Kaiwen Chen and Abolfazl Asudeh and Gautam Das and Nick Koudas},
journal= {arXiv preprint arXiv:2403.00198},
year = {2024}
}