中文

PrExMe! 用于机器翻译和摘要评估的大规模开源 LLM 提示探索

计算与语言 2024-11-19 v2

摘要

大型语言模型 (LLM) 已彻底变革了自然语言处理研究。尤其是,准则学习使其能够作为自然语言生成的评估指标,特别适用于资源匮乏的场景和时间受限的应用。在本工作中,我们引入了 PrExMe,即 Prompt Exploration for Metrics 的大规模探索,其中我们对超过 720 个提示模板进行评估,针对基于开源 LLM 的评估指标进行机器翻译 (MT) 和摘要数据集上的评估,总计超过 660 万次评估。这一大规模比较 (1) 对最近的开源 LLM 作为评估指标进行基准测试 (2) 探索不同的提示策略的稳定性和可变性。我们发现,一方面,有些场景下提示是稳定的。例如,一些 LLM 表现出独特的偏好,倾向于以文本标签对生成文本进行打分,而另一些则倾向于返回数值分数。另一方面,提示和模型排名可能会因看似微不足道的变化而产生显著影响。例如,将请求的输出格式从“0 到 100”改为“-1 到 +1”会显著影响我们评估中的排名。我们的研究促进了对不同提示方法对 MT 和摘要评估中 LLM 基于指标影响的理解,揭示了最稳定的提示模式及潜在局限性。

关键词

引用

@article{arxiv.2406.18528,
  title  = {PrExMe! Large Scale Prompt Exploration of Open Source LLMs for Machine Translation and Summarization Evaluation},
  author = {Christoph Leiter and Steffen Eger},
  journal= {arXiv preprint arXiv:2406.18528},
  year   = {2024}
}

备注

EMNLP 2024 main; camera-ready