SemScore:基于语义文本相似度的指令微调大语言模型自动评估
计算与语言
2024-02-06 v2
摘要
指令微调的大语言模型(LLM)最近在生成对自然语言指令的恰当响应方面展示了显著的进步。然而,许多当前工作依赖人工评估来判断生成响应的质量。由于这种人工评估耗时,因此难以扩展到对多个模型和模型变体的评估。在这篇短文中,我们提出了一种直接但非常有效的评估指标,称为SemScore,其中我们直接使用语义文本相似度(STS)将模型输出与黄金目标响应进行比较。我们使用8种广泛使用的文本生成评估指标,对12个突出的指令微调LLM的模型输出进行了比较评估。我们发现,我们提出的SemScore指标在与人工评估的相关性方面优于所有其他(在许多情况下更复杂的)评估指标。这些发现表明了我们提出的指标在评估指令微调LLM方面的实用性。
引用
@article{arxiv.2401.17072,
title = {SemScore: Automated Evaluation of Instruction-Tuned LLMs based on Semantic Textual Similarity},
author = {Ansar Aynetdinov and Alan Akbik},
journal= {arXiv preprint arXiv:2401.17072},
year = {2024}
}