InFoBench:评估大语言模型的指令遵循能力
计算与语言
2024-01-09 v1 人工智能
摘要
本文介绍了分解需求遵循率(DRFR),一种评估大语言模型(LLM)遵循指令能力的新指标。针对当前方法的空白,DRFR将复杂指令分解为更简单的标准,便于详细分析LLM对任务各个方面的遵从性。伴随这一指标,我们提出了InFoBench,一个包含500条多样化指令和2250个跨多个约束类别的分解问题的基准。我们的实验将DRFR与传统评分方法进行比较,并探索了注释来源,包括人类专家、众包工作者和GPT-4。结果表明DRFR具有更高的可靠性,以及使用GPT-4作为成本效益高的注释者的有效性。使用该框架对几个先进LLM的评估揭示了它们的优势和需要改进的领域,特别是在复杂指令遵循方面。本研究贡献了一个新颖的指标和基准,为未来的LLM开发和评估提供了见解。
引用
@article{arxiv.2401.03601,
title = {InFoBench: Evaluating Instruction Following Ability in Large Language Models},
author = {Yiwei Qin and Kaiqiang Song and Yebowen Hu and Wenlin Yao and Sangwoo Cho and Xiaoyang Wang and Xuansheng Wu and Fei Liu and Pengfei Liu and Dong Yu},
journal= {arXiv preprint arXiv:2401.03601},
year = {2024}
}