评估大型语言模型自由回答中的细微偏差
计算与语言
2024-07-15 v1
摘要
预训练的大型语言模型(Large Language Models, LLMs)现在可以通过自定义提示或微调轻松适配特定的业务目的。这些定制化通常会经过迭代重构以改善某些方面的性能,但在每次更改后,企业都希望确保系统的行为在偏差等关键问题上没有受到负面影响。现有的偏差基准测试方法使用诸如词掩码和多项选择题等技术来大规模评估偏差,但这些方法无法捕捉到自由回答中可能出现的所有细微类型的偏差,而自由回答正是 LLM 系统通常生成的回答类型。在本文中,我们识别了自由文本中几种无法通过多项选择测试类似识别的细微偏差。我们将其描述为:置信偏差、暗示偏差、包容偏差和抹除偏差。我们提出了一种半自动化流水线来检测这些类型的偏差,首先剔除可被自动分类为无偏差的回答,然后利用众包工作者对姓名反转对进行共同评估。我们相信,我们的方法生成的细微分类可用于向 LLMs 提供更好的反馈,尤其是随着 LLM 推理能力的不断增强。
引用
@article{arxiv.2407.08842,
title = {Evaluating Nuanced Bias in Large Language Model Free Response Answers},
author = {Jennifer Healey and Laurie Byrum and Md Nadeem Akhtar and Moumita Sinha},
journal= {arXiv preprint arXiv:2407.08842},
year = {2024}
}
备注
14 pages, 0 figures, submitted to NLDB 2024, Turin, Italy