中文

与人类判断对齐:成对偏好在大型语言模型评估器中的作用

计算与语言 2025-01-20 v5 人工智能 机器学习

摘要

大型语言模型在评估生成自然语言质量方面展现出了作为自动评估器的良好能力。然而,LLM 在评估中仍然表现出偏差,并且常常难以生成与人类评估相一致的连贯评估。在这项工作中,我们首先对 LLM 评估器与人类评估之间的不一致进行了系统研究,揭示了旨在减轻 LLM 偏差的现有校准方法不足以有效地对齐 LLM 评估器。受 RLHF 中偏好数据使用的启发,我们将评估表述为一个排序问题,并引入了成对偏好搜索,这是一种基于不确定性引导的搜索排序聚合方法,它利用 LLM 在局部进行成对比较,并全局高效地对候选文本进行排序。PAIRS 在长文本生成的代表性评估任务上实现了 SOTA 性能,并展现出相较于直接评分的显著改进。此外,我们深入探讨了成对偏好在量化 LLM 传递性中的作用,并展示了 PAIRS 如何受益于使用去偏成对评估的校准。

关键词

引用

@article{arxiv.2403.16950,
  title  = {Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators},
  author = {Yinhong Liu and Han Zhou and Zhijiang Guo and Ehsan Shareghi and Ivan Vulić and Anna Korhonen and Nigel Collier},
  journal= {arXiv preprint arXiv:2403.16950},
  year   = {2025}
}

备注

This paper has been accepted by COLM 2024