中文

SemScore:基于语义文本相似度的指令微调大语言模型自动评估

计算与语言 2024-02-06 v2

摘要

指令微调的大语言模型(LLM)最近在生成对自然语言指令的恰当响应方面展示了显著的进步。然而,许多当前工作依赖人工评估来判断生成响应的质量。由于这种人工评估耗时,因此难以扩展到对多个模型和模型变体的评估。在这篇短文中,我们提出了一种直接但非常有效的评估指标,称为SemScore,其中我们直接使用语义文本相似度(STS)将模型输出与黄金目标响应进行比较。我们使用8种广泛使用的文本生成评估指标,对12个突出的指令微调LLM的模型输出进行了比较评估。我们发现,我们提出的SemScore指标在与人工评估的相关性方面优于所有其他(在许多情况下更复杂的)评估指标。这些发现表明了我们提出的指标在评估指令微调LLM方面的实用性。

关键词

引用

@article{arxiv.2401.17072,
  title  = {SemScore: Automated Evaluation of Instruction-Tuned LLMs based on Semantic Textual Similarity},
  author = {Ansar Aynetdinov and Alan Akbik},
  journal= {arXiv preprint arXiv:2401.17072},
  year   = {2024}
}