中文

LLM作为评分器:输出顺序对对话评估的影响

计算与语言 2024-06-06 v1

摘要

本研究调查了提示设计对使用大型语言模型(LLM)进行对话评估的影响。虽然LLM越来越多地用于对各种输入进行评分,但由于模型敏感性和对话评估的主观性,为对话评估创建有效提示仍然具有挑战性。我们的研究尝试了不同的提示结构,改变了输出指令的顺序并包含解释性理由。我们发现,理由和分数的呈现顺序显著影响LLM的评分,其中“理由优先”的方法产生了更全面的评估。这一见解对于提高基于LLM的评估的准确性和一致性至关重要。

关键词

引用

@article{arxiv.2406.02863,
  title  = {LLM as a Scorer: The Impact of Output Order on Dialogue Evaluation},
  author = {Yi-Pei Chen and KuanChao Chu and Hideki Nakayama},
  journal= {arXiv preprint arXiv:2406.02863},
  year   = {2024}
}

备注

Presented in AAAI 2024 Spring Symposium. The first two authors contributed equally