NarrativeXL:面向长期记忆模型的大规模数据集
计算与语言
2023-12-11 v2 人工智能
摘要
我们提出了一个新型大规模(近百万问题)超长上下文(平均文档长度超过50,000词)阅读理解数据集。我们使用GPT 3.5对来自Project Gutenberg的1500本人工精选小说中的每一场景进行了摘要,每本书约产生150个场景级摘要。此后,我们基于这些摘要创建了若干阅读理解问题,包括三类多项选择场景识别问题,以及自由形式的叙事重构问题。我们的数据集共有990,595个问题,比最接近的替代数据集大一个数量级。关键在于,大多数问题具有已知的“保留需求”,表明回答它们需要多长期的记忆,这应有助于长期记忆性能评估。我们在四个小规模实验中验证了数据:一个使用人类标注者,三个使用现有语言模型。我们表明,我们的问题1)充分代表源材料2)可用于诊断模型的记忆容量3)即使记忆需求未超过现代语言模型的上下文长度,对它们而言也非平凡。最后,我们提供了代码,可用以极少人力进一步扩展数据集。
引用
@article{arxiv.2305.13877,
title = {NarrativeXL: A Large-scale Dataset For Long-Term Memory Models},
author = {Arseny Moskvichev and Ky-Vinh Mai},
journal= {arXiv preprint arXiv:2305.13877},
year = {2023}
}