中文

无需真实答案的大语言模型排序方法

计算与语言 2024-06-11 v4 人工智能 机器学习

摘要

大语言模型(LLMs)的评估与排序问题日益重要,随着这些模型的普及及其影响力。现有的评估方法要么需要昂贵获取的人类响应,要么使用成对的LLMs相互评估,这种方法可能不可靠。本文提出了一种新视角:给定一组提示(即问题、指令等)和一组LLMs,在没有任何真实答案或参考响应的情况下对其进行排序。我们受现实情况的启发,其中既有专家又有有经验者能够识别初学者,我们的主要思想是考虑模型的三元组,其中每个模型都评估其他两个模型,正确地识别最差的模型具有较高概率。我们对该思想进行了分析,并提供了其成功的充分条件。通过反复应用该思想,我们提出了两种排序LLMs的方法。在针对不同生成任务(摘要、多选题、对话)进行实验后,我们的方法在没有参考数据的情况下可靠地恢复接近真实的排序。这指向了一种可用于实际应用的低资源可行机制。

关键词

引用

@article{arxiv.2402.14860,
  title  = {Ranking Large Language Models without Ground Truth},
  author = {Amit Dhurandhar and Rahul Nair and Moninder Singh and Elizabeth Daly and Karthikeyan Natesan Ramamurthy},
  journal= {arXiv preprint arXiv:2402.14860},
  year   = {2024}
}

备注

Accepted to ACL 2024