中文

InFoBench:评估大语言模型的指令遵循能力

计算与语言 2024-01-09 v1 人工智能

摘要

本文介绍了分解需求遵循率(DRFR),一种评估大语言模型(LLM)遵循指令能力的新指标。针对当前方法的空白,DRFR将复杂指令分解为更简单的标准,便于详细分析LLM对任务各个方面的遵从性。伴随这一指标,我们提出了InFoBench,一个包含500条多样化指令和2250个跨多个约束类别的分解问题的基准。我们的实验将DRFR与传统评分方法进行比较,并探索了注释来源,包括人类专家、众包工作者和GPT-4。结果表明DRFR具有更高的可靠性,以及使用GPT-4作为成本效益高的注释者的有效性。使用该框架对几个先进LLM的评估揭示了它们的优势和需要改进的领域,特别是在复杂指令遵循方面。本研究贡献了一个新颖的指标和基准,为未来的LLM开发和评估提供了见解。

关键词

引用

@article{arxiv.2401.03601,
  title  = {InFoBench: Evaluating Instruction Following Ability in Large Language Models},
  author = {Yiwei Qin and Kaiqiang Song and Yebowen Hu and Wenlin Yao and Sangwoo Cho and Xiaoyang Wang and Xuansheng Wu and Fei Liu and Pengfei Liu and Dong Yu},
  journal= {arXiv preprint arXiv:2401.03601},
  year   = {2024}
}