LLM作为评分器:输出顺序对对话评估的影响
计算与语言
2024-06-06 v1
摘要
本研究调查了提示设计对使用大型语言模型(LLM)进行对话评估的影响。虽然LLM越来越多地用于对各种输入进行评分,但由于模型敏感性和对话评估的主观性,为对话评估创建有效提示仍然具有挑战性。我们的研究尝试了不同的提示结构,改变了输出指令的顺序并包含解释性理由。我们发现,理由和分数的呈现顺序显著影响LLM的评分,其中“理由优先”的方法产生了更全面的评估。这一见解对于提高基于LLM的评估的准确性和一致性至关重要。
引用
@article{arxiv.2406.02863,
title = {LLM as a Scorer: The Impact of Output Order on Dialogue Evaluation},
author = {Yi-Pei Chen and KuanChao Chu and Hideki Nakayama},
journal= {arXiv preprint arXiv:2406.02863},
year = {2024}
}
备注
Presented in AAAI 2024 Spring Symposium. The first two authors contributed equally