更好的LLM评估器:提示输出序列与优化的影响
计算与语言
2024-06-28 v1
摘要
本研究探讨了使用大语言模型(LLM)评估生成文本时提示设计的问题。尽管LLM越来越多地用于对各种输入进行评分,但对于开放式文本评估创建有效的提示仍然具有挑战性,因为模型对文本评估高度敏感且主观。我们的研究实验了不同的提示结构,改变了输出指令的顺序,并包括解释原因。我们发现,呈现原因和分数的顺序对LLM的评分有显著影响,提示中规则理解程度不同。若有足够的数据,额外的优化可能提高评分的对齐度。这一见解对于提高LLM基于评估的准确性和一致性至关重要。
引用
@article{arxiv.2406.09972,
title = {A Better LLM Evaluator for Text Generation: The Impact of Prompt Output Sequencing and Optimization},
author = {KuanChao Chu and Yi-Pei Chen and Hideki Nakayama},
journal= {arXiv preprint arXiv:2406.09972},
year = {2024}
}
备注
Presented in JSAI 2024. The first two authors contributed equally. arXiv admin note: substantial text overlap with arXiv:2406.02863