ZeroSCROLLS:一个用于长文本理解的零样本基准
计算与语言
2023-12-19 v3 人工智能
机器学习
机器学习
摘要
我们提出ZeroSCROLLS,一个面向长文本自然语言理解的零样本基准,其仅含测试集与小型验证集,无训练数据。我们改编自SCROLLS基准的六项任务,并新增四个数据集,包括两个新颖的信息融合任务,如聚合正面评论的百分比。利用ZeroSCROLLS,我们对开源与闭源大语言模型进行了综合评估,发现Claude优于ChatGPT,且GPT-4取得最高平均分。然而,ZeroSCROLLS中仍存在多处开放挑战的改进空间,例如聚合任务中模型难以超越朴素基线。由于最优水平不断变化,我们邀请研究者在活跃的ZeroSCROLLS排行榜上评估其方法。
引用
@article{arxiv.2305.14196,
title = {ZeroSCROLLS: A Zero-Shot Benchmark for Long Text Understanding},
author = {Uri Shaham and Maor Ivgi and Avia Efrat and Jonathan Berant and Omer Levy},
journal= {arXiv preprint arXiv:2305.14196},
year = {2023}
}
备注
Findings of EMNLP 2023