人类反馈并非黄金标准
计算与语言
2024-01-17 v2
摘要
人类反馈已成为评估大语言模型(Large Language Model, LLM)性能的事实标准,并日益被用作训练目标。然而,这一单一的“偏好”分数究竟捕捉了生成输出的哪些属性尚不清楚。我们假设偏好分数具有主观性且易受不良偏差影响。我们批判性地分析了人类反馈在训练和评估两方面的使用,以验证其是否充分涵盖一系列关键的错误准则。我们发现,尽管偏好分数具有相当好的覆盖度,但它们低估了事实性等重要方面。我们进一步假设偏好分数与错误标注都可能受到混杂因素的影响,并利用指令微调模型生成在两种可能的混杂维度——自信度与复杂度——上有所变化的输出。我们发现输出的自信度会扭曲所感知的事实性错误率,表明人类标注并非完全可靠的评估指标或训练目标。最后,我们提供初步证据表明,将人类反馈用作训练目标会不成比例地增加模型输出的自信度。我们鼓励未来工作仔细考量偏好分数是否与期望目标良好对齐。
引用
@article{arxiv.2309.16349,
title = {Human Feedback is not Gold Standard},
author = {Tom Hosking and Phil Blunsom and Max Bartolo},
journal= {arXiv preprint arXiv:2309.16349},
year = {2024}
}
备注
Accepted at ICLR 2024