中文

HELMET:有效且彻底评估长上下文语言模型的方法

计算与语言 2025-03-07 v3 人工智能

摘要

尽管存在许多用于评估长上下文语言模型(LCLMs)的基准测试,但开发者往往依赖于合成任务,如针 needle-in-a-haystack(NIAH)或任意子任务集合。然而,人们仍不清楚这些基准测试是否反映了LCLMs的下游应用的多样性,而这种不一致性进一步使模型比较复杂化。我们研究了这些实践背后的原因,发现现有基准测试常常由于应用覆盖不足、上下文长度不足、指标不可靠以及与基础模型不兼容而提供噪声信号。在本工作中,我们引入了HELMET(How to Evaluate Long-context Models Effectively and Thoroughly),一个涵盖七个多样且以应用为中心的类别的综合基准测试。我们还通过添加可控制的长度至128K token、基于模型的评估以获得可靠指标以及few-shot prompting来对现有基准测试的几个问题进行了修正。因此,我们证明HELMET为前沿LCLMs提供了更可靠和一致的排名。通过对59个LCLMs的全面研究,我们发现:(1)诸如NIAH等合成任务不可靠地预测下游性能;(2)HELMET中的 diverse 类别之间存在显著差异且相关性较低;(3)虽然大多数LCLMs在NIAH得分上达到完美,但开源模型在需要完整上下文推理或遵循复杂指令的任务上显著落后于闭源模型——随着长度增加,这一差距也随之扩大。最后,我们建议使用我们的RAG任务进行快速模型开发,因为它们易于运行且更好地预测其他下游性能;最终,我们倡导在多样化任务上进行整体评估。

关键词

引用

@article{arxiv.2410.02694,
  title  = {HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly},
  author = {Howard Yen and Tianyu Gao and Minmin Hou and Ke Ding and Daniel Fleischer and Peter Izsak and Moshe Wasserblat and Danqi Chen},
  journal= {arXiv preprint arXiv:2410.02694},
  year   = {2025}
}

备注

ICLR 2025. Project page: https://princeton-nlp.github.io/HELMET/