一千零一对:长上下文语言模型的“小说”挑战
计算与语言
2024-10-23 v3 人工智能
摘要
合成式长上下文大语言模型基准(如“大海捞针”)仅测试表面层次的检索能力,但长上下文大语言模型在书籍长度的输入中检索、综合并推理信息的能力究竟如何?我们通过创建NoCha数据集来回答这一问题,该数据集包含1001对关于67本近期出版的英文虚构小说的真假陈述,这些陈述由阅读过这些书籍的人类读者撰写。与现有的长上下文基准相比,我们的标注者确认,NoCha中最大比例的陈述对需要通读全书进行全局推理才能验证。我们的实验表明,尽管人类读者能轻松完成此任务,但对我们测试的所有十个长上下文大语言模型来说,这一任务极具挑战性:没有开放权重模型的表现超过随机水平(尽管它们在合成基准上表现强劲),而GPT-4o以55.8%的准确率取得最高成绩。进一步分析显示:(1)平均而言,模型在仅需句子级检索的陈述对上的表现远好于需要全局推理的陈述对;(2)模型对其决策生成的解释通常不准确,即使对正确标注的陈述也是如此;(3)模型在包含大量世界观构建的科幻小说上表现明显更差。NoCha中提出的方法使得基准数据集的演进和未来模型的简便分析成为可能。
引用
@article{arxiv.2406.16264,
title = {One Thousand and One Pairs: A "novel" challenge for long-context language models},
author = {Marzena Karpinska and Katherine Thai and Kyle Lo and Tanya Goyal and Mohit Iyyer},
journal= {arXiv preprint arXiv:2406.16264},
year = {2024}
}
备注
EMNLP 2024, camera ready