PrExMe! 用于机器翻译和摘要评估的大规模开源 LLM 提示探索
计算与语言
2024-11-19 v2
摘要
大型语言模型 (LLM) 已彻底变革了自然语言处理研究。尤其是,准则学习使其能够作为自然语言生成的评估指标,特别适用于资源匮乏的场景和时间受限的应用。在本工作中,我们引入了 PrExMe,即 Prompt Exploration for Metrics 的大规模探索,其中我们对超过 720 个提示模板进行评估,针对基于开源 LLM 的评估指标进行机器翻译 (MT) 和摘要数据集上的评估,总计超过 660 万次评估。这一大规模比较 (1) 对最近的开源 LLM 作为评估指标进行基准测试 (2) 探索不同的提示策略的稳定性和可变性。我们发现,一方面,有些场景下提示是稳定的。例如,一些 LLM 表现出独特的偏好,倾向于以文本标签对生成文本进行打分,而另一些则倾向于返回数值分数。另一方面,提示和模型排名可能会因看似微不足道的变化而产生显著影响。例如,将请求的输出格式从“0 到 100”改为“-1 到 +1”会显著影响我们评估中的排名。我们的研究促进了对不同提示方法对 MT 和摘要评估中 LLM 基于指标影响的理解,揭示了最稳定的提示模式及潜在局限性。
引用
@article{arxiv.2406.18528,
title = {PrExMe! Large Scale Prompt Exploration of Open Source LLMs for Machine Translation and Summarization Evaluation},
author = {Christoph Leiter and Steffen Eger},
journal= {arXiv preprint arXiv:2406.18528},
year = {2024}
}
备注
EMNLP 2024 main; camera-ready