GLaPE:面向大语言模型的黄金标签无关提示评估与优化
计算与语言
2024-12-03 v2 机器学习
摘要
尽管大型语言模型(LLM)取得了快速进展,但其任务性能对提示设计仍然很敏感。最近的研究探索了利用LLM自身作为优化器,以寻找最大化任务准确率的最佳提示。然而,在评估提示时,此类方法严重依赖难以获取的人工标注黄金标签来计算每个候选提示的任务准确率,这阻碍了其广泛实施和通用性。为了克服这一限制,本工作提出了一种黄金标签无关的提示评估(GLaPE),以减轻对黄金标签的依赖。受观察到的自洽性与答案准确率之间相关性的启发,我们采用自洽性作为初始评估分数。随后,我们对产生相同答案的提示的分数进行细化,使其相互一致。实验结果表明,即使在没有黄金标签的情况下,GLaPE也能提供与准确率一致的可靠评估。此外,在六个流行的推理任务上,我们基于GLaPE的提示优化产生了与基于准确率的优化相当的有效提示。代码公开于 https://github.com/thunderous77/GLaPE。
引用
@article{arxiv.2402.02408,
title = {GLaPE: Gold Label-agnostic Prompt Evaluation and Optimization for Large Language Model},
author = {Xuanchang Zhang and Zhuosheng Zhang and Hai Zhao},
journal= {arXiv preprint arXiv:2402.02408},
year = {2024}
}
备注
EMNLP 2024