中文

更好的LLM评估器:提示输出序列与优化的影响

计算与语言 2024-06-28 v1

摘要

本研究探讨了使用大语言模型(LLM)评估生成文本时提示设计的问题。尽管LLM越来越多地用于对各种输入进行评分,但对于开放式文本评估创建有效的提示仍然具有挑战性,因为模型对文本评估高度敏感且主观。我们的研究实验了不同的提示结构,改变了输出指令的顺序,并包括解释原因。我们发现,呈现原因和分数的顺序对LLM的评分有显著影响,提示中规则理解程度不同。若有足够的数据,额外的优化可能提高评分的对齐度。这一见解对于提高LLM基于评估的准确性和一致性至关重要。

关键词

引用

@article{arxiv.2406.09972,
  title  = {A Better LLM Evaluator for Text Generation: The Impact of Prompt Output Sequencing and Optimization},
  author = {KuanChao Chu and Yi-Pei Chen and Hideki Nakayama},
  journal= {arXiv preprint arXiv:2406.09972},
  year   = {2024}
}

备注

Presented in JSAI 2024. The first two authors contributed equally. arXiv admin note: substantial text overlap with arXiv:2406.02863