OffsetBias: 利用去偏数据微调评估器
计算与语言
2024-10-08 v2
摘要
使用大型语言模型(LLM)评估生成响应的质量,例如提示指令微调模型或微调评判模型,已成为一种广泛采用的评估方法。众所周知,此类评估器容易受到偏见的影响,例如偏好更长的响应。虽然克服这个问题很重要,但这些偏见的细节仍未得到充分探索。在这项工作中,我们定性地识别了各种评判模型中固有的六种偏见类型。我们提出 EvalBiasBench 作为针对每种偏见类型的手工测试用例的元评估集合。此外,我们提出了去偏数据集构建方法和相关的偏好数据集 OffsetBias。实验结果表明,在我们的数据集上进行微调显著增强了评判模型对偏见的鲁棒性,并提高了在大多数评估场景中的性能。我们将我们的数据集和微调后的评判模型公开发布。
引用
@article{arxiv.2407.06551,
title = {OffsetBias: Leveraging Debiased Data for Tuning Evaluators},
author = {Junsoo Park and Seungyeon Jwa and Meiying Ren and Daeyoung Kim and Sanghyuk Choi},
journal= {arXiv preprint arXiv:2407.06551},
year = {2024}
}
备注
EMNLP2024 Findings