ChapterBreak:面向长程语言模型的挑战数据集
计算与语言
2022-04-26 v1
摘要
尽管近期提出了众多长程语言模型(LRLM)架构,但对其语篇层面语言理解能力的恰当评估尚未跟进。为此,我们引入 ChapterBreak,一个挑战数据集,它向 LRLM 提供一段来自叙事的长片段,该片段结束于章节边界,并要求模型从同一叙事中采样的若干负片段里辨别出真实下一章的开头。细粒度人工标注显示,我们的数据集包含许多复杂类型的章节过渡(例如平行叙事、悬念式结尾),需要处理的全局上下文才能理解。在 ChapterBreak 上的实验表明,现有 LRLM 未能有效利用长程上下文,大幅落后于直接为此任务训练的片段级模型。我们公开发布 ChapterBreak 数据集,以推动未来对 LRLM 更规范的研究。
引用
@article{arxiv.2204.10878,
title = {ChapterBreak: A Challenge Dataset for Long-Range Language Models},
author = {Simeng Sun and Katherine Thai and Mohit Iyyer},
journal= {arXiv preprint arXiv:2204.10878},
year = {2022}
}