许多Shot In-Context学习能否帮助LLM作为评估器?一项初步经验研究
计算与语言
2025-02-06 v6
摘要
利用大语言模型 (LLM) 作为评估器来评估大语言模型的性能已引起关注。然而,这种评估方法受到LLM内部潜在偏见的影响,引发对评估结果准确性和可靠性的担忧。为此,我们提出并研究了两种许多Shot In-Context Learning (ICL) 提示模板,以帮助LLM评估器缓解潜在偏见:Many-Shot with Reference (MSwR) 和 Many-Shot without Reference (MSoR)。具体而言,前者利用带有模型生成评估理由作为参考的上下文示例,后者则不包括这些参考。通过这些提示设计,我们研究了增加上下文示例数量对评估结果一致性和质量的影响。实验结果表明,诸如GPT-4o等高级LLM在许多Shot情境下表现优于零Shot和fewShot情境。此外,当使用GPT-4o作为许多Shot情境下的评估器时,采用MSwR作为提示模板的表现优于MSoR。
引用
@article{arxiv.2406.11629,
title = {Can Many-Shot In-Context Learning Help LLMs as Evaluators? A Preliminary Empirical Study},
author = {Mingyang Song and Mao Zheng and Xuan Luo and Yue Pan},
journal= {arXiv preprint arXiv:2406.11629},
year = {2025}
}
备注
Accepted by COLING 2025