INSTRUCTEVAL:面向指令微调大语言模型的整体评估
计算与语言
2023-06-16 v3 人工智能
摘要
指令微调大语言模型已革新自然语言处理,并在对话智能体等应用中展现出巨大潜力。这些模型(如 GPT-4)不仅能掌握语言,还能解决数学、编程、医学和法律等领域的复杂任务。尽管能力令人印象深刻,但由于许多模型的黑箱性质以及缺乏整体评估研究,对其全部潜力的理解仍不全面。为应对这些挑战,我们提出 INSTRUCTEVAL,一个专为指令微调大语言模型设计的更全面的评估套件。与以往工作不同,我们的评估基于对问题解决、写作能力和与人类价值观对齐的严格评测。我们采用整体方法分析影响模型性能的各种因素,包括预训练基础、指令微调数据和训练方法。我们的发现表明,指令数据的质量是衡量模型性能扩展的最关键因素。虽然开源模型展现出令人印象深刻的写作能力,但在问题解决和对齐方面仍有很大改进空间。我们对开源社区模型的快速发展感到鼓舞,但也强调需要严格评估以支持有关这些模型的论断。通过 INSTRUCTEVAL,我们旨在促进对指令微调模型及其能力进展的更深理解。INSTRUCTEVAL 公开于 https://github.com/declare-lab/instruct-eval。
引用
@article{arxiv.2306.04757,
title = {INSTRUCTEVAL: Towards Holistic Evaluation of Instruction-Tuned Large Language Models},
author = {Yew Ken Chia and Pengfei Hong and Lidong Bing and Soujanya Poria},
journal= {arXiv preprint arXiv:2306.04757},
year = {2023}
}
备注
Github: https://github.com/declare-lab/instruct-eval Leaderboard: https://declare-lab.github.io/instruct-eval/