中文

用于评估偏差的大语言模型软提示微调

计算与语言 2024-03-06 v2 人工智能 机器学习

摘要

近年来,提示大语言模型因其即便无需标注数据也能产生良好结果的优势而极受欢迎。然而,这需要提示微调以获得带来更优模型性能的最优提示。在本文中,我们探索在情感分类任务上使用软提示微调来量化大语言模型(LLM)如 Open Pre-trained Transformers (OPT) 和 Galactica 语言模型的偏差。由于这些模型在可能偏向特定人群的真实世界数据上训练,识别这些潜在问题十分重要。使用软提示评估偏差给了我们额外的优势,可避免由手动设计提示引起的人类偏差注入。我们利用群体公平性(偏差)检查模型在不同敏感属性上的偏差,并发现了有趣的偏差模式。由于 LLM 已在工业界各种应用中使用,在实践部署这些模型前识别偏差至关重要。我们开源了我们的流程,并鼓励工业界研究者将我们的工作适配到其用例中。

关键词

引用

@article{arxiv.2306.04735,
  title  = {Soft-prompt Tuning for Large Language Models to Evaluate Bias},
  author = {Jacob-Junqi Tian and David Emerson and Sevil Zanjani Miyandoab and Deval Pandya and Laleh Seyyed-Kalantari and Faiza Khan Khattak},
  journal= {arXiv preprint arXiv:2306.04735},
  year   = {2024}
}