中文

ZeroSCROLLS:一个用于长文本理解的零样本基准

计算与语言 2023-12-19 v3 人工智能 机器学习 机器学习

摘要

我们提出ZeroSCROLLS,一个面向长文本自然语言理解的零样本基准,其仅含测试集与小型验证集,无训练数据。我们改编自SCROLLS基准的六项任务,并新增四个数据集,包括两个新颖的信息融合任务,如聚合正面评论的百分比。利用ZeroSCROLLS,我们对开源与闭源大语言模型进行了综合评估,发现Claude优于ChatGPT,且GPT-4取得最高平均分。然而,ZeroSCROLLS中仍存在多处开放挑战的改进空间,例如聚合任务中模型难以超越朴素基线。由于最优水平不断变化,我们邀请研究者在活跃的ZeroSCROLLS排行榜上评估其方法。

关键词

引用

@article{arxiv.2305.14196,
  title  = {ZeroSCROLLS: A Zero-Shot Benchmark for Long Text Understanding},
  author = {Uri Shaham and Maor Ivgi and Avia Efrat and Jonathan Berant and Omer Levy},
  journal= {arXiv preprint arXiv:2305.14196},
  year   = {2023}
}

备注

Findings of EMNLP 2023