基于 ChatGPT 的数据增强用于改进大语言模型的参数高效去偏
计算与语言
2024-09-17 v2 人工智能
计算机与社会
摘要
大语言模型 (LLM) 虽然功能强大,但表现出有害的社会偏见。由于计算成本、数据限制以及多任务语言能力潜在退化等原因,去偏往往具有挑战性。这项工作介绍了一种利用 ChatGPT 生成合成训练数据的新方法,旨在增强 LLM 的去偏效果。我们提出了两种策略:目标提示 (Targeted Prompting),可为已知偏见提供有效的去偏,但需要预先指定问题中的偏见;以及通用提示 (General Prompting),虽然效果稍逊,但能提供跨各类别的去偏。我们利用适配器微调 (adapter tuning) 进行资源高效的 LLM 去偏,并将我们的合成数据与现有的去偏数据集进行比较。我们的结果表明:(1) ChatGPT 可以高效地为其他 LLM 的去偏产生高质量训练数据;(2) 通过我们的方法产生的数据在去偏性能上优于现有数据集,同时保留了预训练 LLM 的内部知识;(3) 合成数据表现出跨类别的泛化能力,有效缓解了包括交叉性偏见在内的各种偏见。这些发现强调了合成数据在以最小重训练成本推进 LLM 公平性方面的潜力。
引用
@article{arxiv.2402.11764,
title = {ChatGPT Based Data Augmentation for Improved Parameter-Efficient Debiasing of LLMs},
author = {Pengrui Han and Rafal Kocielnik and Adhithya Saravanan and Roy Jiang and Or Sharir and Anima Anandkumar},
journal= {arXiv preprint arXiv:2402.11764},
year = {2024}
}
备注
To Appear in the Proceedings of the 1st Conference on Language Modeling (COLM) 2024