ETHIC:评估大语言模型在长上下文任务中的信息覆盖能力
计算与语言
2025-02-28 v2
摘要
近期大型语言模型(LLM)在处理极长文本方面取得了进展,凸显了对评估其长上下文能力的专门基准测试的需求。然而,现有方法如针 needle-in-a-haystack 测试,未能有效评估这些模型是否充分利用上下文信息,引发对当前评估技术可靠性的疑虑。为彻底检视现有基准的有效性,我们提出了一种新指标,即信息覆盖(IC),用于量化回答查询所需的输入上下文比例。我们的发现表明,当前基准的IC得分较低;尽管输入上下文可能很庞大,但实际可用上下文往往有限。为此,我们提出ETHIC,一个新型基准,用于评估LLM利用整个上下文的能力。该基准涵盖1986个测试实例,涉及书籍、辩论、医疗和法律等四个长上下文任务,IC得分较高。我们的评估显示,当代LLM在处理长上下文时表现显著下降,凸显了管理长上下文的关键挑战。我们的基准已在https://github.com/dmis-lab/ETHIC上发布。
引用
@article{arxiv.2410.16848,
title = {ETHIC: Evaluating Large Language Models on Long-Context Tasks with High Information Coverage},
author = {Taewhoo Lee and Chanwoong Yoon and Kyochul Jang and Donghyeon Lee and Minju Song and Hyunjae Kim and Jaewoo Kang},
journal= {arXiv preprint arXiv:2410.16848},
year = {2025}
}
备注
NAACL 2025