HelloBench:评估大型语言模型的长文本生成能力
计算与语言
2024-09-25 v1
摘要
近年来,大型语言模型(LLM)在各种任务(例如长上下文理解)中展现出了卓越的能力,并且已有许多基准被提出。然而,我们观察到长文本生成能力尚未得到充分研究。因此,我们提出了分层长文本生成基准(HelloBench),这是一个全面、自然且开放式的基准,用于评估 LLM 在生成长文本方面的表现。基于 Bloom 分类法,HelloBench 将长文本生成任务分为五个子任务:开放式问答、摘要、聊天、文本补全和启发式文本生成。此外,我们提出了分层长文本评估(HelloEval),这是一种与人类对齐的评估方法,在保持与人类评估高度相关性的同时,显著减少了人工评估所需的时间和精力。我们对大约 30 个主流 LLM 进行了广泛实验,观察到当前的 LLM 缺乏长文本生成能力。具体而言,首先,无论指令是否包含显式或隐式的长度约束,我们观察到大多数 LLM 无法生成超过 4000 词的文本。其次,我们观察到尽管部分 LLM 能够生成更长的文本,但存在许多问题(例如严重的重复和质量下降)。第三,为了证明 HelloEval 的有效性,我们将其与传统指标(例如 ROUGE、BLEU 等)以及 LLM-as-a-Judge 方法进行了比较,结果表明 HelloEval 与人类评估的相关性最高。我们在 https://github.com/Quehry/HelloBench 发布了代码。
引用
@article{arxiv.2409.16191,
title = {HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models},
author = {Haoran Que and Feiyu Duan and Liqun He and Yutao Mou and Wangchunshu Zhou and Jiaheng Liu and Wenge Rong and Zekun Moore Wang and Jian Yang and Ge Zhang and Junran Peng and Zhaoxiang Zhang and Songyang Zhang and Kai Chen},
journal= {arXiv preprint arXiv:2409.16191},
year = {2024}
}