中文

迈向更好的指令遵循评估:以摘要任务为案例研究

计算与语言 2023-10-23 v2 人工智能 机器学习

摘要

尽管近期取得了进展,评估大语言模型(LLMs)遵循用户指令的能力仍然是一个开放性问题。虽然语言模型的评估方法出现了越来越多基于提示的方法,但关于这些方法正确性的研究十分有限。在这项工作中,我们对多种指标进行了元评估,以量化它们衡量LLMs指令遵循能力的准确程度。我们的研究在基于查询的 grounding 摘要上展开,通过收集一个新的短文本、真实世界数据集 riSum,包含300个文档-指令对,每个对配有3个答案。所有900个答案均由3名人类标注者评分。利用 riSum,我们分析了评估方法与人类判断之间的一致性。最后,我们提出了新的基于LLM的无参考评估方法,这些方法优于已有的基线,并与需要高质量摘要的、代价高昂的基于参考的指标表现相当。

关键词

引用

@article{arxiv.2310.08394,
  title  = {Towards Better Evaluation of Instruction-Following: A Case-Study in Summarization},
  author = {Ondrej Skopek and Rahul Aralikatte and Sian Gooding and Victor Carbune},
  journal= {arXiv preprint arXiv:2310.08394},
  year   = {2023}
}

备注

CoNLL 2023 camera-ready version