面向故事结局生成的大语言模型指令遵循能力评估
计算与语言
2024-06-25 v1
摘要
指令调优后的大型语言模型(LLM)在各类基准任务上已取得显著成绩。虽然通过提供指令来指导其生成对用户而言比较友好,但由于缺乏评估指标,评估其指令遵循能力仍不明确。本文聚焦于在故事结局生成语境中评估 LLM 的指令遵循能力,这一任务需要多样且特定于情境的指令。我们提出了一种自动评估管道,利用机器阅读理解(MRC)模型来判断生成的故事结局是否反映指令。我们的发现表明,所提出的指标与人类评估一致。此外,我们的实验确认,最新的开源 LLM 可通过自动评估实现接近 GPT-3.5 的指令遵循性能。
引用
@article{arxiv.2406.16356,
title = {Evaluation of Instruction-Following Ability for Large Language Models on Story-Ending Generation},
author = {Rem Hida and Junki Ohmura and Toshiyuki Sekiya},
journal= {arXiv preprint arXiv:2406.16356},
year = {2024}
}