HREF:语言模型中指令遵循的人类响应引导评估
计算与语言
2025-03-26 v2 人工智能
摘要
评估大型语言模型(LLM)遵循指令的能力严重依赖于强大的 LLM 作为评判者,这引入了未解决的偏差,使得评判偏离人类评判者。在本工作中,我们在广泛的指令遵循任务上重新评估了自动评估的各种选择。我们实验了利用人类撰写响应的方法,并观察到它们提高了广泛任务上自动评估的可靠性,使得与人类评判者的一致性提升了高达 3.2%。我们还发现,在遵循指令方面,人类撰写的响应为模型生成的响应提供了一个正交的视角,在比较模型响应时应将其用作附加上下文。基于这些观察,我们开发了一个新的评估基准,即人类响应引导的指令遵循评估(HREF),包含跨 11 个任务类别的 4,258 个样本,采用复合评估设置,该设置为每个类别选择最可靠的方法。除了提供可靠的评估外,HREF 强调单个任务性能且不受污染。最后,我们研究了 HREF 中关键设计选择的影响,包括评估集大小、评判模型、基线模型和提示模板。我们托管了一个实时排行榜,在 HREF 的私有评估集上评估 LLM。
引用
@article{arxiv.2412.15524,
title = {HREF: Human Response-Guided Evaluation of Instruction Following in Language Models},
author = {Xinxi Lyu and Yizhong Wang and Hannaneh Hajishirzi and Pradeep Dasigi},
journal= {arXiv preprint arXiv:2412.15524},
year = {2025}
}
备注
28 pages, 15 figures