中文

面向人类一致性的 LLM 评估:可证明保证的信任或升级机制

机器学习 2024-07-29 v1 计算与语言

摘要

我们提出了一种原则方法,为LLM-based 评估提供严格的人类一致性保证。首先,我们提出可靠的评估方法不应无批判地依赖模型偏好进行成对评估,而应评估评判模型的置信水平,并有选择地决定何时信任其判断。随后我们表明,在该选择性评估框架下,可严格保证人类一致性——即模型评估与人类评估在用户指定的一致性水平上对齐。作为本框架的一部分,我们还引入了Simulated Annotators,这是一种显著提高评判模型校准以实现高覆盖率的置信估计方法。最后,我们提出了级联选择性评估(cascaded selective evaluation),其中我们使用较便宜的模型作为初始评判者,仅在必要时升级到更强的模型——同时仍能提供人类一致性的可证明保证。实验结果表明,级联选择性评估能够保证与人类的强大一致性,这远超LLM评判者在没有选择性评估的情况下能够实现的程度。例如,在Chatbot Arena的一个子集上,GPT-4几乎永远无法实现80%的人类一致性,而我们的方法即使采用像Mistral-7B这样相对具有成本效益的模型,也能保证超过80%的人类一致性,并实现约80%的测试覆盖率。

关键词

引用

@article{arxiv.2407.18370,
  title  = {Trust or Escalate: LLM Judges with Provable Guarantees for Human Agreement},
  author = {Jaehun Jung and Faeze Brahman and Yejin Choi},
  journal= {arXiv preprint arXiv:2407.18370},
  year   = {2024}
}